AI Model Speed Rankings

Models ranked by measured output throughput (tokens per second) and average latency.

  1. Google gemini-2.5-pro — Throughput: 1994.8 tps, Latency: 2661.00s
  2. ByteDance Seedance 2.0 — Throughput: 1160.2 tps, Latency: 280047.00s
  3. TypeSafe Jev — Throughput: 856.7 tps, Latency: 0.00s
  4. ByteDance Seedance 2.0 Mini — Throughput: 788.3 tps, Latency: 191655.50s
  5. ByteDance Seedance 2.5 — Throughput: 536.0 tps, Latency: 172947.25s
  6. Google Gemini 3.6 Flash — Throughput: 497.7 tps, Latency: 6469.12s
  7. xAI Grok 4.20 Multi-Agent — Throughput: 388.4 tps, Latency: 2882.00s
  8. OpenAI GPT Image 2.5 Dev — Throughput: 282.9 tps, Latency: 20260.00s
  9. Google Gemini 3.1 Flash-Lite Preview — Throughput: 274.4 tps, Latency: 0.00s
  10. Google Gemini 3.8 Flash — Throughput: 234.9 tps, Latency: 7455.72s
  11. OpenAI chatgpt-image-latest — Throughput: 231.3 tps, Latency: 18840.00s
  12. Google Gemini 3 Flash Preview — Throughput: 230.3 tps, Latency: 3167.65s
  13. Google Nano Banana (Gemini 2.5 Flash Image 🍌) — Throughput: 206.1 tps, Latency: 0.00s
  14. ByteDance Doubao-Seedream-5.0-pro — Throughput: 197.1 tps, Latency: 38308.00s
  15. OpenAI GPT-5 — Throughput: 189.3 tps, Latency: 10113.75s
  16. OpenAI gpt-4-gizmo-* — Throughput: 177.2 tps, Latency: 4538.50s
  17. DeepSeek DeepSeek V4.1 Flash — Throughput: 173.8 tps, Latency: 1908.33s
  18. OpenAI gpt-5-nano — Throughput: 172.3 tps, Latency: 1206.62s
  19. Google Gemini 3.5 Flash — Throughput: 161.0 tps, Latency: 10400.00s
  20. Xiaomi MiMo-V2.6-Flash — Throughput: 159.1 tps, Latency: 1697.00s
  21. OpenAI GPT-5.6 Luna — Throughput: 149.2 tps, Latency: 1545.69s
  22. Google Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image 🍌) — Throughput: 149.1 tps, Latency: 9874.67s
  23. Anthropic Claude Claude Sonnet 5.5 — Throughput: 148.5 tps, Latency: 1794.20s
  24. OpenAI gpt-oss-120b — Throughput: 147.3 tps, Latency: 0.00s
  25. DeepSeek DeepSeek-V4-Flash 0731 — Throughput: 137.6 tps, Latency: 2173.00s
  26. xAI grok-3-mini — Throughput: 136.3 tps, Latency: 1182.00s
  27. OpenAI gpt-4-turbo-preview — Throughput: 130.2 tps, Latency: 2823.50s
  28. OpenAI GPT Image 1.5 — Throughput: 126.9 tps, Latency: 52580.00s
  29. OpenAI GPT-5.4 Nano — Throughput: 123.0 tps, Latency: 4504.71s
  30. OpenAI GPT Image 1.0 — Throughput: 119.2 tps, Latency: 52338.00s
  31. xAI Grok 4.20 — Throughput: 113.1 tps, Latency: 1300.00s
  32. xAI Grok Build 0.1 — Throughput: 113.0 tps, Latency: 0.00s
  33. Anthropic Claude Claude Opus 5.5 — Throughput: 112.0 tps, Latency: 3336.11s
  34. xAI Grok 4.3 — Throughput: 109.4 tps, Latency: 2046.89s
  35. xAI grok-3 — Throughput: 105.7 tps, Latency: 0.00s
  36. OpenAI gpt-5-search-api — Throughput: 104.8 tps, Latency: 0.00s
  37. OpenAI gpt-4o-2024-08-06 — Throughput: 101.8 tps, Latency: 0.00s
  38. Alibaba Qwen3.8-Flash — Throughput: 100.1 tps, Latency: 0.00s
  39. xAI grok-4-0709 — Throughput: 96.0 tps, Latency: 1747.00s
  40. Z.ai GLM 5.1 — Throughput: 92.5 tps, Latency: 800.00s
  41. DeepSeek DeepSeek-V4-Flash — Throughput: 89.6 tps, Latency: 769.00s
  42. xAI grok-4-1-fast-reasoning — Throughput: 88.5 tps, Latency: 0.00s
  43. OpenAI GPT-5.5 — Throughput: 85.6 tps, Latency: 2542.25s
  44. Thinking Machines Thinking Machines: Inkling — Throughput: 85.6 tps, Latency: 0.00s
  45. OpenAI gpt-image-1-mini — Throughput: 85.2 tps, Latency: 12396.10s
  46. OpenAI GPT-6 Sol — Throughput: 85.2 tps, Latency: 2080.20s
  47. Alibaba qwen3-8b — Throughput: 82.2 tps, Latency: 309.00s
  48. xAI Grok 4.7 — Throughput: 81.9 tps, Latency: 2605.61s
  49. Moonshot Kimi K3 — Throughput: 79.0 tps, Latency: 3453.50s
  50. Anthropic Claude Claude Opus 5 — Throughput: 78.1 tps, Latency: 4409.74s
  51. Anthropic Claude Claude Sonnet 5 — Throughput: 74.9 tps, Latency: 3550.59s
  52. Z.ai GLM 5 — Throughput: 74.5 tps, Latency: 623.00s
  53. DeepSeek DeepSeek-V4-Pro-0813 — Throughput: 73.6 tps, Latency: 1261.00s
  54. OpenAI GPT-5.6 Sol — Throughput: 70.9 tps, Latency: 8222.12s
  55. xAI Grok 4.20 (Non-Reasoning) — Throughput: 68.9 tps, Latency: 0.00s
  56. xAI Grok 4.6 — Throughput: 65.7 tps, Latency: 3963.96s
  57. OpenAI GPT-5.4 Mini — Throughput: 64.3 tps, Latency: 1611.00s
  58. Moonshot kimi-k2-thinking — Throughput: 61.1 tps, Latency: 460.00s
  59. Google Gemini 3 Pro Preview — Throughput: 60.5 tps, Latency: 0.00s
  60. Z.ai GLM 5.2 — Throughput: 59.9 tps, Latency: 566.00s
  61. xAI Grok 4.5 — Throughput: 59.6 tps, Latency: 1282.33s
  62. xAI grok-4-fast-non-reasoning — Throughput: 58.8 tps, Latency: 490.00s
  63. xAI grok-4-fast-reasoning — Throughput: 58.8 tps, Latency: 0.00s
  64. Z.ai GLM 4.7 — Throughput: 57.3 tps, Latency: 402.00s
  65. OpenAI GPT-5.6 Terra — Throughput: 56.5 tps, Latency: 2659.86s
  66. Xiaomi MiMo-V2.5 — Throughput: 53.5 tps, Latency: 2102.60s
  67. Alibaba qwen3-vl-flash — Throughput: 53.4 tps, Latency: 0.00s
  68. Xiaomi MiMo-V2.6-Pro — Throughput: 52.5 tps, Latency: 11010.80s
  69. Google Gemini 3.7 Flash — Throughput: 51.7 tps, Latency: 14239.67s
  70. DeepSeek DeepSeek-V3.2 — Throughput: 51.3 tps, Latency: 829.50s
  71. OpenAI GPT-5.1 — Throughput: 51.2 tps, Latency: 3280.00s
  72. DeepSeek deepseek-v3.1 — Throughput: 51.1 tps, Latency: 571.00s
  73. DeepSeek deepseek-v3 — Throughput: 51.0 tps, Latency: 2730.67s
  74. OpenAI GPT-5.4 — Throughput: 50.2 tps, Latency: 2143.00s
  75. OpenAI GPT-6.1 Sol — Throughput: 49.6 tps, Latency: 4126.77s
  76. ByteDance Doubao-Seed-2.1-pro — Throughput: 48.8 tps, Latency: 0.00s
  77. Alibaba qwen3-vl-flash-2025-10-15 — Throughput: 47.5 tps, Latency: 0.00s
  78. MiniMax MiniMax M3 — Throughput: 44.9 tps, Latency: 2801.00s
  79. OpenAI gpt-5-mini — Throughput: 44.7 tps, Latency: 3978.33s
  80. Alibaba qvq-plus — Throughput: 44.4 tps, Latency: 0.00s
  81. MiniMax minimax-m2 — Throughput: 43.8 tps, Latency: 0.00s
  82. Anthropic Claude Claude Opus 4.7 — Throughput: 43.0 tps, Latency: 1643.89s
  83. MiniMax MiniMax M2.5 Lightning — Throughput: 42.4 tps, Latency: 1500.00s
  84. Anthropic Claude Claude Opus 4.8 — Throughput: 39.8 tps, Latency: 4957.75s
  85. OpenAI GPT-6 Luna — Throughput: 39.2 tps, Latency: 8120.40s
  86. Google Gemini 3.1 Flash-Lite — Throughput: 37.6 tps, Latency: 2351.43s
  87. OpenAI GPT Image 2.5 Sunburst — Throughput: 37.5 tps, Latency: 33598.69s
  88. Anthropic Claude Claude Fable 5.1 — Throughput: 37.4 tps, Latency: 15832.00s
  89. OpenAI GPT-5.4 Pro — Throughput: 36.1 tps, Latency: 607.00s
  90. OpenAI GPT Image 2 Develop — Throughput: 34.6 tps, Latency: 41202.15s
  91. Google Gemini 3.1 Pro Preview — Throughput: 34.5 tps, Latency: 13424.48s
  92. ByteDance Doubao-Seed-2.0-pro — Throughput: 28.6 tps, Latency: 0.00s
  93. Anthropic Claude Claude Sonnet 4.6 — Throughput: 27.8 tps, Latency: 1843.83s
  94. ByteDance Doubao-Seed-2.0-mini — Throughput: 27.8 tps, Latency: 0.00s
  95. OpenAI GPT Image 2.5 Flare — Throughput: 27.5 tps, Latency: 17419.74s
  96. Alibaba qwen-coder-plus — Throughput: 27.2 tps, Latency: 0.00s
  97. Alibaba qwen-coder-plus-1106 — Throughput: 25.5 tps, Latency: 0.00s
  98. OpenAI GPT Image 2 — Throughput: 24.1 tps, Latency: 41525.31s
  99. Moonshot Kimi K2.5 — Throughput: 23.4 tps, Latency: 326.00s
  100. MiniMax minimax-m2.1 — Throughput: 23.4 tps, Latency: 0.00s