AI Model Speed Rankings
Models ranked by measured output throughput (tokens per second) and average latency.
- Google gemini-2.5-pro — Throughput: 1994.8 tps, Latency: 2661.00s
- ByteDance Seedance 2.0 — Throughput: 1160.2 tps, Latency: 280047.00s
- TypeSafe Jev — Throughput: 856.7 tps, Latency: 0.00s
- ByteDance Seedance 2.0 Mini — Throughput: 788.3 tps, Latency: 191655.50s
- ByteDance Seedance 2.5 — Throughput: 536.0 tps, Latency: 172947.25s
- Google Gemini 3.6 Flash — Throughput: 497.7 tps, Latency: 6469.12s
- xAI Grok 4.20 Multi-Agent — Throughput: 388.4 tps, Latency: 2882.00s
- OpenAI GPT Image 2.5 Dev — Throughput: 282.9 tps, Latency: 20260.00s
- Google Gemini 3.1 Flash-Lite Preview — Throughput: 274.4 tps, Latency: 0.00s
- Google Gemini 3.8 Flash — Throughput: 234.9 tps, Latency: 7455.72s
- OpenAI chatgpt-image-latest — Throughput: 231.3 tps, Latency: 18840.00s
- Google Gemini 3 Flash Preview — Throughput: 230.3 tps, Latency: 3167.65s
- Google Nano Banana (Gemini 2.5 Flash Image 🍌) — Throughput: 206.1 tps, Latency: 0.00s
- ByteDance Doubao-Seedream-5.0-pro — Throughput: 197.1 tps, Latency: 38308.00s
- OpenAI GPT-5 — Throughput: 189.3 tps, Latency: 10113.75s
- OpenAI gpt-4-gizmo-* — Throughput: 177.2 tps, Latency: 4538.50s
- DeepSeek DeepSeek V4.1 Flash — Throughput: 173.8 tps, Latency: 1908.33s
- OpenAI gpt-5-nano — Throughput: 172.3 tps, Latency: 1206.62s
- Google Gemini 3.5 Flash — Throughput: 161.0 tps, Latency: 10400.00s
- Xiaomi MiMo-V2.6-Flash — Throughput: 159.1 tps, Latency: 1697.00s
- OpenAI GPT-5.6 Luna — Throughput: 149.2 tps, Latency: 1545.69s
- Google Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image 🍌) — Throughput: 149.1 tps, Latency: 9874.67s
- Anthropic Claude Claude Sonnet 5.5 — Throughput: 148.5 tps, Latency: 1794.20s
- OpenAI gpt-oss-120b — Throughput: 147.3 tps, Latency: 0.00s
- DeepSeek DeepSeek-V4-Flash 0731 — Throughput: 137.6 tps, Latency: 2173.00s
- xAI grok-3-mini — Throughput: 136.3 tps, Latency: 1182.00s
- OpenAI gpt-4-turbo-preview — Throughput: 130.2 tps, Latency: 2823.50s
- OpenAI GPT Image 1.5 — Throughput: 126.9 tps, Latency: 52580.00s
- OpenAI GPT-5.4 Nano — Throughput: 123.0 tps, Latency: 4504.71s
- OpenAI GPT Image 1.0 — Throughput: 119.2 tps, Latency: 52338.00s
- xAI Grok 4.20 — Throughput: 113.1 tps, Latency: 1300.00s
- xAI Grok Build 0.1 — Throughput: 113.0 tps, Latency: 0.00s
- Anthropic Claude Claude Opus 5.5 — Throughput: 112.0 tps, Latency: 3336.11s
- xAI Grok 4.3 — Throughput: 109.4 tps, Latency: 2046.89s
- xAI grok-3 — Throughput: 105.7 tps, Latency: 0.00s
- OpenAI gpt-5-search-api — Throughput: 104.8 tps, Latency: 0.00s
- OpenAI gpt-4o-2024-08-06 — Throughput: 101.8 tps, Latency: 0.00s
- Alibaba Qwen3.8-Flash — Throughput: 100.1 tps, Latency: 0.00s
- xAI grok-4-0709 — Throughput: 96.0 tps, Latency: 1747.00s
- Z.ai GLM 5.1 — Throughput: 92.5 tps, Latency: 800.00s
- DeepSeek DeepSeek-V4-Flash — Throughput: 89.6 tps, Latency: 769.00s
- xAI grok-4-1-fast-reasoning — Throughput: 88.5 tps, Latency: 0.00s
- OpenAI GPT-5.5 — Throughput: 85.6 tps, Latency: 2542.25s
- Thinking Machines Thinking Machines: Inkling — Throughput: 85.6 tps, Latency: 0.00s
- OpenAI gpt-image-1-mini — Throughput: 85.2 tps, Latency: 12396.10s
- OpenAI GPT-6 Sol — Throughput: 85.2 tps, Latency: 2080.20s
- Alibaba qwen3-8b — Throughput: 82.2 tps, Latency: 309.00s
- xAI Grok 4.7 — Throughput: 81.9 tps, Latency: 2605.61s
- Moonshot Kimi K3 — Throughput: 79.0 tps, Latency: 3453.50s
- Anthropic Claude Claude Opus 5 — Throughput: 78.1 tps, Latency: 4409.74s
- Anthropic Claude Claude Sonnet 5 — Throughput: 74.9 tps, Latency: 3550.59s
- Z.ai GLM 5 — Throughput: 74.5 tps, Latency: 623.00s
- DeepSeek DeepSeek-V4-Pro-0813 — Throughput: 73.6 tps, Latency: 1261.00s
- OpenAI GPT-5.6 Sol — Throughput: 70.9 tps, Latency: 8222.12s
- xAI Grok 4.20 (Non-Reasoning) — Throughput: 68.9 tps, Latency: 0.00s
- xAI Grok 4.6 — Throughput: 65.7 tps, Latency: 3963.96s
- OpenAI GPT-5.4 Mini — Throughput: 64.3 tps, Latency: 1611.00s
- Moonshot kimi-k2-thinking — Throughput: 61.1 tps, Latency: 460.00s
- Google Gemini 3 Pro Preview — Throughput: 60.5 tps, Latency: 0.00s
- Z.ai GLM 5.2 — Throughput: 59.9 tps, Latency: 566.00s
- xAI Grok 4.5 — Throughput: 59.6 tps, Latency: 1282.33s
- xAI grok-4-fast-non-reasoning — Throughput: 58.8 tps, Latency: 490.00s
- xAI grok-4-fast-reasoning — Throughput: 58.8 tps, Latency: 0.00s
- Z.ai GLM 4.7 — Throughput: 57.3 tps, Latency: 402.00s
- OpenAI GPT-5.6 Terra — Throughput: 56.5 tps, Latency: 2659.86s
- Xiaomi MiMo-V2.5 — Throughput: 53.5 tps, Latency: 2102.60s
- Alibaba qwen3-vl-flash — Throughput: 53.4 tps, Latency: 0.00s
- Xiaomi MiMo-V2.6-Pro — Throughput: 52.5 tps, Latency: 11010.80s
- Google Gemini 3.7 Flash — Throughput: 51.7 tps, Latency: 14239.67s
- DeepSeek DeepSeek-V3.2 — Throughput: 51.3 tps, Latency: 829.50s
- OpenAI GPT-5.1 — Throughput: 51.2 tps, Latency: 3280.00s
- DeepSeek deepseek-v3.1 — Throughput: 51.1 tps, Latency: 571.00s
- DeepSeek deepseek-v3 — Throughput: 51.0 tps, Latency: 2730.67s
- OpenAI GPT-5.4 — Throughput: 50.2 tps, Latency: 2143.00s
- OpenAI GPT-6.1 Sol — Throughput: 49.6 tps, Latency: 4126.77s
- ByteDance Doubao-Seed-2.1-pro — Throughput: 48.8 tps, Latency: 0.00s
- Alibaba qwen3-vl-flash-2025-10-15 — Throughput: 47.5 tps, Latency: 0.00s
- MiniMax MiniMax M3 — Throughput: 44.9 tps, Latency: 2801.00s
- OpenAI gpt-5-mini — Throughput: 44.7 tps, Latency: 3978.33s
- Alibaba qvq-plus — Throughput: 44.4 tps, Latency: 0.00s
- MiniMax minimax-m2 — Throughput: 43.8 tps, Latency: 0.00s
- Anthropic Claude Claude Opus 4.7 — Throughput: 43.0 tps, Latency: 1643.89s
- MiniMax MiniMax M2.5 Lightning — Throughput: 42.4 tps, Latency: 1500.00s
- Anthropic Claude Claude Opus 4.8 — Throughput: 39.8 tps, Latency: 4957.75s
- OpenAI GPT-6 Luna — Throughput: 39.2 tps, Latency: 8120.40s
- Google Gemini 3.1 Flash-Lite — Throughput: 37.6 tps, Latency: 2351.43s
- OpenAI GPT Image 2.5 Sunburst — Throughput: 37.5 tps, Latency: 33598.69s
- Anthropic Claude Claude Fable 5.1 — Throughput: 37.4 tps, Latency: 15832.00s
- OpenAI GPT-5.4 Pro — Throughput: 36.1 tps, Latency: 607.00s
- OpenAI GPT Image 2 Develop — Throughput: 34.6 tps, Latency: 41202.15s
- Google Gemini 3.1 Pro Preview — Throughput: 34.5 tps, Latency: 13424.48s
- ByteDance Doubao-Seed-2.0-pro — Throughput: 28.6 tps, Latency: 0.00s
- Anthropic Claude Claude Sonnet 4.6 — Throughput: 27.8 tps, Latency: 1843.83s
- ByteDance Doubao-Seed-2.0-mini — Throughput: 27.8 tps, Latency: 0.00s
- OpenAI GPT Image 2.5 Flare — Throughput: 27.5 tps, Latency: 17419.74s
- Alibaba qwen-coder-plus — Throughput: 27.2 tps, Latency: 0.00s
- Alibaba qwen-coder-plus-1106 — Throughput: 25.5 tps, Latency: 0.00s
- OpenAI GPT Image 2 — Throughput: 24.1 tps, Latency: 41525.31s
- Moonshot Kimi K2.5 — Throughput: 23.4 tps, Latency: 326.00s
- MiniMax minimax-m2.1 — Throughput: 23.4 tps, Latency: 0.00s