Space Computing Energy Tech Transport Science Dev Loyalty ↗ ◐ Dark mode ◎ Enable Alerts
Compare · GPUs & AI chips

Trainium2 vs TPU v5p

RANKED BY DENSE FP16/BF16 TENSOR TFLOPS PER CHIP #12 VS #13 CHECKED 06 SEPT 2026
Side by side
Verdict

Trainium2 ranks #12 of 20 on Dense FP16/BF16 tensor TFLOPS per chip (667 TFLOPS); TPU v5p ranks #13 (459 TFLOPS).

Rank 12 of 20 · leads
Dense FP16/BF16 tensor TFLOPS per chip
667 TFLOPS
MakerAWS
Date2024
Verified04 Sept 2026
Evidence
AWS Neuron Trainium2 Architecture page, compute table: each Trainium2 chip delivers "667 BF16/FP16/TF32 TFLOPS" dense; sparse counterpart is 2,563 TFLOPS and was not used. 96 GiB device memory. Trn2 instances are generally available (AWS announcement 3 Dec 2024).
Rank 13 of 20
Dense FP16/BF16 tensor TFLOPS per chip
459 TFLOPS
MakerGoogle
Date2023
Verified04 Sept 2026
Evidence
Google Cloud TPU v5p documentation, per-chip specification table: "Peak compute per chip (BF16) (TFLOPs) 459". Same page lists FP8 at 459 TFLOPs. 95 GiB HBM per chip.
Try another pair
Source Vendor product pages and official spec documents (AMD Instinct MI355X / MI350X / MI325X / MI300X / MI300A / MI250X / MI250 / MI210; NVIDIA… Last checked 06 Sept 2026
Full GPUs & AI chips ranking Spot an error? Send a tip