Space Computing Energy Tech Transport Science Dev Loyalty ↗ ◐ Dark mode ◎ Enable Alerts
Compare · GPUs & AI chips

Trainium2 vs Gaudi 2

RANKED BY DENSE FP16/BF16 TENSOR TFLOPS PER CHIP #12 VS #14 CHECKED 06 SEPT 2026
Side by side
Verdict

Trainium2 ranks #12 of 20 on Dense FP16/BF16 tensor TFLOPS per chip (667 TFLOPS); Gaudi 2 ranks #14 (432 TFLOPS).

Rank 12 of 20 · leads
Dense FP16/BF16 tensor TFLOPS per chip
667 TFLOPS
MakerAWS
Date2024
Verified04 Sept 2026
Evidence
AWS Neuron Trainium2 Architecture page, compute table: each Trainium2 chip delivers "667 BF16/FP16/TF32 TFLOPS" dense; sparse counterpart is 2,563 TFLOPS and was not used. 96 GiB device memory. Trn2 instances are generally available (AWS announcement 3 Dec 2024).
Rank 14 of 20
Dense FP16/BF16 tensor TFLOPS per chip
432 TFLOPS
MakerIntel
Date2022
Verified04 Sept 2026
Evidence
Intel Gaudi 3 white paper (document 817486) comparison table lists Gaudi 2 "BF16 MME TFLOPS 432" and "FP8 MME TFLOPS 865". This row uses the BF16 MME cell. 96 GB HBM2e. The same comparison table is the official Intel source already used for the Gaudi 3 row.
Try another pair
Source Vendor product pages and official spec documents (AMD Instinct MI355X / MI350X / MI325X / MI300X / MI300A / MI250X / MI250 / MI210; NVIDIA… Last checked 06 Sept 2026
Full GPUs & AI chips ranking Spot an error? Send a tip