# AI Latency Tracker Updated July 23, 2026. Independent, provider-neutral latency and uptime of 45 AI inference APIs, measured from 4 regions with distributed probes and updated automatically. Figures are measured, not scraped. ## By region - [Fastest AI API from Asia (Tokyo)](https://llmlatency.dev/region/ap-tokyo) - [Fastest AI API from Europe (Germany)](https://llmlatency.dev/region/eu-hetzner) - [Fastest AI API from South America (São Paulo)](https://llmlatency.dev/region/sa-east) - [Fastest AI API from US (Central)](https://llmlatency.dev/region/us-central) ## By provider - [ai21](https://llmlatency.dev/provider/ai21) - [aleph-alpha](https://llmlatency.dev/provider/aleph-alpha) - [anthropic](https://llmlatency.dev/provider/anthropic) - [baichuan](https://llmlatency.dev/provider/baichuan) - [baseten](https://llmlatency.dev/provider/baseten) - [cerebras](https://llmlatency.dev/provider/cerebras) - [cohere](https://llmlatency.dev/provider/cohere) - [deepinfra](https://llmlatency.dev/provider/deepinfra) - [deepseek](https://llmlatency.dev/provider/deepseek) - [doubao](https://llmlatency.dev/provider/doubao) - [ernie](https://llmlatency.dev/provider/ernie) - [featherless](https://llmlatency.dev/provider/featherless) - [fireworks](https://llmlatency.dev/provider/fireworks) - [friendli](https://llmlatency.dev/provider/friendli) - [glm](https://llmlatency.dev/provider/glm) - [google](https://llmlatency.dev/provider/google) - [groq](https://llmlatency.dev/provider/groq) - [hunyuan](https://llmlatency.dev/provider/hunyuan) - [hyperbolic](https://llmlatency.dev/provider/hyperbolic) - [iflytek](https://llmlatency.dev/provider/iflytek) - [inference-net](https://llmlatency.dev/provider/inference-net) - [kimi](https://llmlatency.dev/provider/kimi) - [meta-llama](https://llmlatency.dev/provider/meta-llama) - [minimax](https://llmlatency.dev/provider/minimax) - [mistral](https://llmlatency.dev/provider/mistral) - [nebius](https://llmlatency.dev/provider/nebius) - [novita](https://llmlatency.dev/provider/novita) - [nscale](https://llmlatency.dev/provider/nscale) - [openai](https://llmlatency.dev/provider/openai) - [openrouter](https://llmlatency.dev/provider/openrouter) - [perplexity](https://llmlatency.dev/provider/perplexity) - [qwen](https://llmlatency.dev/provider/qwen) - [reka](https://llmlatency.dev/provider/reka) - [replicate](https://llmlatency.dev/provider/replicate) - [sambanova](https://llmlatency.dev/provider/sambanova) - [sarvam](https://llmlatency.dev/provider/sarvam) - [sensenova](https://llmlatency.dev/provider/sensenova) - [siliconflow](https://llmlatency.dev/provider/siliconflow) - [stepfun](https://llmlatency.dev/provider/stepfun) - [targon](https://llmlatency.dev/provider/targon) - [together](https://llmlatency.dev/provider/together) - [upstage](https://llmlatency.dev/provider/upstage) - [writer](https://llmlatency.dev/provider/writer) - [xai](https://llmlatency.dev/provider/xai) - [yi-01ai](https://llmlatency.dev/provider/yi-01ai) ## More - [AI model deprecation & migration calendar](https://llmlatency.dev/deprecations) - [llms.txt](https://llmlatency.dev/llms.txt) · [llms-full.txt](https://llmlatency.dev/llms-full.txt) --- # Fastest AI API from Asia (Tokyo) Updated July 23, 2026. Independent, provider-neutral edge latency (TTFB) and uptime by provider, measured from Asia (Tokyo), updated automatically. As of July 23, 2026, measured from Asia (Tokyo), the fastest AI inference API by edge latency (time-to-first-byte) is **fireworks** at 10 ms p50 (n=95). ## Edge latency (time-to-first-byte) | # | Provider | p50 | p95 | Uptime | Samples | | --- | --- | --- | --- | --- | --- | | 1 | fireworks | 10 ms | 42 ms | 100% | 95 | | 2 | sambanova | 20 ms | 58 ms | 100% | 72 | | 3 | openrouter | 52 ms | 87 ms | 100% | 95 | | 4 | google | 55 ms | 80 ms | 100% | 95 | | 5 | upstage | 60 ms | 80 ms | 100% | 72 | | 6 | kimi | 126 ms | 163 ms | 100% | 77 | | 7 | meta-llama | 127 ms | 344 ms | 100% | 72 | | 8 | ernie | 138 ms | 143 ms | 100% | 72 | | 9 | groq | 144 ms | 188 ms | 100% | 95 | | 10 | novita | 144 ms | 168 ms | 100% | 72 | | 11 | baseten | 156 ms | 169 ms | 100% | 72 | | 12 | cohere | 166 ms | 194 ms | 100% | 95 | | 13 | deepseek | 168 ms | 232 ms | 100% | 95 | | 14 | xai | 174 ms | 740 ms | 100% | 95 | | 15 | replicate | 175 ms | 470 ms | 100% | 72 | | 16 | baichuan | 183 ms | 421 ms | 99% | 72 | | 17 | together | 186 ms | 373 ms | 100% | 95 | | 18 | qwen | 190 ms | 248 ms | 100% | 77 | | 19 | friendli | 191 ms | 256 ms | 100% | 72 | | 20 | minimax | 195 ms | 241 ms | 100% | 77 | | 21 | cerebras | 201 ms | 283 ms | 100% | 95 | | 22 | openai | 205 ms | 261 ms | 100% | 95 | | 23 | perplexity | 227 ms | 574 ms | 100% | 72 | | 24 | writer | 241 ms | 272 ms | 100% | 72 | | 25 | iflytek | 244 ms | 855 ms | 100% | 72 | | 26 | sarvam | 245 ms | 261 ms | 100% | 72 | | 27 | anthropic | 247 ms | 415 ms | 100% | 95 | | 28 | reka | 288 ms | 980 ms | 100% | 72 | | 29 | sensenova | 290 ms | 756 ms | 100% | 72 | | 30 | ai21 | 300 ms | 394 ms | 100% | 72 | | 31 | stepfun | 302 ms | 763 ms | 100% | 72 | | 32 | mistral | 307 ms | 353 ms | 100% | 95 | | 33 | targon | 321 ms | 334 ms | 100% | 72 | | 34 | yi-01ai | 334 ms | 821 ms | 99% | 72 | | 35 | glm | 348 ms | 385 ms | 100% | 77 | | 36 | inference-net | 363 ms | 986 ms | 100% | 72 | | 37 | siliconflow | 382 ms | 402 ms | 100% | 72 | | 38 | doubao | 389 ms | 1110 ms | 100% | 72 | | 39 | nscale | 457 ms | 490 ms | 100% | 72 | | 40 | hyperbolic | 493 ms | 550 ms | 100% | 72 | | 41 | deepinfra | 503 ms | 684 ms | 100% | 72 | | 42 | featherless | 511 ms | 4040 ms | 100% | 72 | | 43 | nebius | 550 ms | 598 ms | 100% | 72 | | 44 | aleph-alpha | 577 ms | 652 ms | 100% | 72 | | 45 | hunyuan | 1120 ms | 1149 ms | 100% | 72 | Source: https://llmlatency.dev/region/ap-tokyo --- # Fastest AI API from Europe (Germany) Updated July 23, 2026. Independent, provider-neutral edge latency (TTFB) and uptime by provider, measured from Europe (Germany), updated automatically. As of July 23, 2026, measured from Europe (Germany), the fastest AI inference API by edge latency (time-to-first-byte) is **nscale** at 97 ms p50 (n=75). ## Edge latency (time-to-first-byte) | # | Provider | p50 | p95 | Uptime | Samples | | --- | --- | --- | --- | --- | --- | | 1 | nscale | 97 ms | 195 ms | 100% | 75 | | 2 | fireworks | 98 ms | 201 ms | 100% | 110 | | 3 | google | 98 ms | 199 ms | 100% | 110 | | 4 | openrouter | 98 ms | 198 ms | 100% | 110 | | 5 | nebius | 99 ms | 204 ms | 100% | 75 | | 6 | mistral | 100 ms | 202 ms | 100% | 110 | | 7 | reka | 100 ms | 298 ms | 100% | 75 | | 8 | meta-llama | 100 ms | 299 ms | 100% | 75 | | 9 | aleph-alpha | 102 ms | 295 ms | 100% | 75 | | 10 | baichuan | 178 ms | 610 ms | 100% | 75 | | 11 | baseten | 197 ms | 289 ms | 100% | 75 | | 12 | cerebras | 198 ms | 392 ms | 100% | 110 | | 13 | inference-net | 198 ms | 900 ms | 100% | 75 | | 14 | anthropic | 199 ms | 402 ms | 100% | 110 | | 15 | cohere | 199 ms | 310 ms | 100% | 110 | | 16 | friendli | 200 ms | 395 ms | 100% | 75 | | 17 | replicate | 201 ms | 498 ms | 100% | 75 | | 18 | perplexity | 206 ms | 402 ms | 100% | 75 | | 19 | ernie | 280 ms | 285 ms | 100% | 75 | | 20 | openai | 294 ms | 495 ms | 100% | 110 | | 21 | writer | 294 ms | 400 ms | 100% | 75 | | 22 | siliconflow | 296 ms | 394 ms | 100% | 75 | | 23 | groq | 296 ms | 401 ms | 100% | 110 | | 24 | sarvam | 296 ms | 308 ms | 100% | 75 | | 25 | together | 297 ms | 500 ms | 100% | 110 | | 26 | novita | 298 ms | 500 ms | 100% | 75 | | 27 | xai | 298 ms | 806 ms | 100% | 110 | | 28 | iflytek | 298 ms | 750 ms | 100% | 75 | | 29 | deepseek | 299 ms | 498 ms | 99% | 110 | | 30 | kimi | 299 ms | 401 ms | 100% | 80 | | 31 | hyperbolic | 301 ms | 798 ms | 100% | 75 | | 32 | minimax | 302 ms | 500 ms | 100% | 80 | | 33 | targon | 303 ms | 362 ms | 100% | 75 | | 34 | ai21 | 303 ms | 502 ms | 100% | 75 | | 35 | yi-01ai | 319 ms | 401 ms | 100% | 75 | | 36 | doubao | 358 ms | 827 ms | 100% | 75 | | 37 | sensenova | 390 ms | 1035 ms | 100% | 75 | | 38 | sambanova | 395 ms | 498 ms | 100% | 75 | | 39 | qwen | 398 ms | 501 ms | 100% | 80 | | 40 | stepfun | 435 ms | 1105 ms | 100% | 75 | | 41 | upstage | 548 ms | 855 ms | 100% | 75 | | 42 | deepinfra | 595 ms | 795 ms | 100% | 75 | | 43 | featherless | 701 ms | 1199 ms | 100% | 75 | | 44 | glm | 801 ms | 1401 ms | 100% | 80 | | 45 | hunyuan | 1544 ms | 2314 ms | 100% | 75 | Source: https://llmlatency.dev/region/eu-hetzner --- # Fastest AI API from South America (São Paulo) Updated July 23, 2026. Independent, provider-neutral edge latency (TTFB) and uptime by provider, measured from South America (São Paulo), updated automatically. As of July 23, 2026, measured from South America (São Paulo), the fastest AI inference API by edge latency (time-to-first-byte) is **openrouter** at 55 ms p50 (n=95). ## Edge latency (time-to-first-byte) | # | Provider | p50 | p95 | Uptime | Samples | | --- | --- | --- | --- | --- | --- | | 1 | openrouter | 55 ms | 67 ms | 100% | 95 | | 2 | baseten | 150 ms | 158 ms | 100% | 72 | | 3 | google | 154 ms | 644 ms | 100% | 95 | | 4 | cohere | 158 ms | 176 ms | 100% | 95 | | 5 | cerebras | 184 ms | 218 ms | 100% | 95 | | 6 | replicate | 193 ms | 473 ms | 100% | 72 | | 7 | friendli | 193 ms | 322 ms | 100% | 72 | | 8 | perplexity | 201 ms | 250 ms | 100% | 72 | | 9 | anthropic | 212 ms | 603 ms | 100% | 95 | | 10 | openai | 215 ms | 386 ms | 100% | 95 | | 11 | meta-llama | 222 ms | 246 ms | 100% | 72 | | 12 | groq | 227 ms | 255 ms | 100% | 95 | | 13 | novita | 235 ms | 273 ms | 100% | 72 | | 14 | writer | 240 ms | 273 ms | 100% | 72 | | 15 | mistral | 250 ms | 293 ms | 100% | 95 | | 16 | together | 258 ms | 714 ms | 100% | 95 | | 17 | fireworks | 263 ms | 285 ms | 100% | 95 | | 18 | reka | 264 ms | 668 ms | 100% | 72 | | 19 | siliconflow | 274 ms | 285 ms | 100% | 72 | | 20 | inference-net | 307 ms | 1051 ms | 100% | 72 | | 21 | ai21 | 309 ms | 401 ms | 100% | 72 | | 22 | targon | 322 ms | 329 ms | 100% | 72 | | 23 | kimi | 338 ms | 369 ms | 100% | 77 | | 24 | baichuan | 339 ms | 1203 ms | 100% | 72 | | 25 | xai | 345 ms | 960 ms | 100% | 95 | | 26 | nscale | 407 ms | 409 ms | 100% | 72 | | 27 | ernie | 410 ms | 419 ms | 100% | 72 | | 28 | sambanova | 412 ms | 429 ms | 99% | 72 | | 29 | deepseek | 426 ms | 457 ms | 100% | 95 | | 30 | minimax | 452 ms | 491 ms | 100% | 77 | | 31 | nebius | 457 ms | 481 ms | 100% | 72 | | 32 | aleph-alpha | 482 ms | 556 ms | 100% | 72 | | 33 | yi-01ai | 494 ms | 525 ms | 100% | 72 | | 34 | deepinfra | 590 ms | 652 ms | 100% | 72 | | 35 | sarvam | 600 ms | 626 ms | 100% | 72 | | 36 | upstage | 606 ms | 646 ms | 100% | 72 | | 37 | sensenova | 612 ms | 671 ms | 100% | 72 | | 38 | iflytek | 642 ms | 1549 ms | 100% | 72 | | 39 | glm | 650 ms | 657 ms | 100% | 77 | | 40 | stepfun | 659 ms | 711 ms | 100% | 72 | | 41 | doubao | 682 ms | 1582 ms | 100% | 72 | | 42 | qwen | 712 ms | 805 ms | 100% | 77 | | 43 | featherless | 756 ms | 3520 ms | 99% | 72 | | 44 | hyperbolic | 786 ms | 866 ms | 100% | 72 | | 45 | hunyuan | 1655 ms | 1671 ms | 100% | 72 | Source: https://llmlatency.dev/region/sa-east --- # Fastest AI API from US (Central) Updated July 23, 2026. Independent, provider-neutral edge latency (TTFB) and uptime by provider, measured from US (Central), updated automatically. As of July 23, 2026, measured from US (Central), the fastest AI inference API by edge latency (time-to-first-byte) is **fireworks** at 25 ms p50 (n=95). ## Edge latency (time-to-first-byte) | # | Provider | p50 | p95 | Uptime | Samples | | --- | --- | --- | --- | --- | --- | | 1 | fireworks | 25 ms | 63 ms | 100% | 95 | | 2 | google | 36 ms | 93 ms | 100% | 95 | | 3 | meta-llama | 49 ms | 110 ms | 100% | 72 | | 4 | baseten | 55 ms | 68 ms | 100% | 72 | | 5 | openrouter | 58 ms | 114 ms | 100% | 95 | | 6 | cohere | 60 ms | 112 ms | 100% | 95 | | 7 | cerebras | 64 ms | 130 ms | 100% | 95 | | 8 | novita | 66 ms | 126 ms | 100% | 72 | | 9 | friendli | 80 ms | 248 ms | 100% | 72 | | 10 | replicate | 81 ms | 133 ms | 100% | 72 | | 11 | siliconflow | 82 ms | 100 ms | 100% | 72 | | 12 | targon | 90 ms | 99 ms | 100% | 72 | | 13 | perplexity | 102 ms | 145 ms | 100% | 72 | | 14 | anthropic | 107 ms | 246 ms | 100% | 95 | | 15 | groq | 116 ms | 169 ms | 100% | 95 | | 16 | openai | 117 ms | 206 ms | 100% | 95 | | 17 | together | 129 ms | 183 ms | 100% | 95 | | 18 | writer | 133 ms | 166 ms | 100% | 72 | | 19 | xai | 136 ms | 846 ms | 100% | 95 | | 20 | sambanova | 149 ms | 183 ms | 100% | 72 | | 21 | ai21 | 159 ms | 236 ms | 100% | 72 | | 22 | inference-net | 161 ms | 199 ms | 100% | 72 | | 23 | hyperbolic | 170 ms | 282 ms | 100% | 72 | | 24 | mistral | 175 ms | 244 ms | 100% | 95 | | 25 | nscale | 196 ms | 210 ms | 100% | 72 | | 26 | reka | 198 ms | 474 ms | 100% | 72 | | 27 | nebius | 218 ms | 288 ms | 100% | 72 | | 28 | deepinfra | 229 ms | 720 ms | 100% | 72 | | 29 | baichuan | 231 ms | 856 ms | 100% | 72 | | 30 | kimi | 265 ms | 333 ms | 100% | 77 | | 31 | ernie | 271 ms | 277 ms | 100% | 72 | | 32 | aleph-alpha | 305 ms | 458 ms | 100% | 72 | | 33 | deepseek | 307 ms | 355 ms | 100% | 95 | | 34 | upstage | 317 ms | 336 ms | 100% | 72 | | 35 | minimax | 322 ms | 356 ms | 100% | 77 | | 36 | yi-01ai | 364 ms | 996 ms | 100% | 72 | | 37 | featherless | 365 ms | 2798 ms | 100% | 72 | | 38 | glm | 387 ms | 428 ms | 100% | 77 | | 39 | stepfun | 419 ms | 1064 ms | 100% | 72 | | 40 | sensenova | 421 ms | 1064 ms | 100% | 72 | | 41 | iflytek | 431 ms | 2236 ms | 99% | 72 | | 42 | sarvam | 433 ms | 463 ms | 100% | 72 | | 43 | qwen | 437 ms | 491 ms | 100% | 77 | | 44 | doubao | 481 ms | 1210 ms | 100% | 72 | | 45 | hunyuan | 1379 ms | 1387 ms | 100% | 72 | Source: https://llmlatency.dev/region/us-central --- # ai21 — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the ai21 API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 300 ms | 394 ms | 100% | | Europe (Germany) | 303 ms | 502 ms | 100% | | South America (São Paulo) | 309 ms | 401 ms | 100% | | US (Central) | 159 ms | 236 ms | 100% | Source: https://llmlatency.dev/provider/ai21 --- # aleph-alpha — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the aleph-alpha API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 577 ms | 652 ms | 100% | | Europe (Germany) | 102 ms | 295 ms | 100% | | South America (São Paulo) | 482 ms | 556 ms | 100% | | US (Central) | 305 ms | 458 ms | 100% | Source: https://llmlatency.dev/provider/aleph-alpha --- # anthropic — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the anthropic API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 247 ms | 415 ms | 100% | | Europe (Germany) | 199 ms | 402 ms | 100% | | South America (São Paulo) | 212 ms | 603 ms | 100% | | US (Central) | 107 ms | 246 ms | 100% | Source: https://llmlatency.dev/provider/anthropic --- # baichuan — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the baichuan API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 183 ms | 421 ms | 99% | | Europe (Germany) | 178 ms | 610 ms | 100% | | South America (São Paulo) | 339 ms | 1203 ms | 100% | | US (Central) | 231 ms | 856 ms | 100% | Source: https://llmlatency.dev/provider/baichuan --- # baseten — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the baseten API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 156 ms | 169 ms | 100% | | Europe (Germany) | 197 ms | 289 ms | 100% | | South America (São Paulo) | 150 ms | 158 ms | 100% | | US (Central) | 55 ms | 68 ms | 100% | Source: https://llmlatency.dev/provider/baseten --- # cerebras — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the cerebras API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 201 ms | 283 ms | 100% | | Europe (Germany) | 198 ms | 392 ms | 100% | | South America (São Paulo) | 184 ms | 218 ms | 100% | | US (Central) | 64 ms | 130 ms | 100% | Source: https://llmlatency.dev/provider/cerebras --- # cohere — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the cohere API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 166 ms | 194 ms | 100% | | Europe (Germany) | 199 ms | 310 ms | 100% | | South America (São Paulo) | 158 ms | 176 ms | 100% | | US (Central) | 60 ms | 112 ms | 100% | Source: https://llmlatency.dev/provider/cohere --- # deepinfra — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the deepinfra API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 503 ms | 684 ms | 100% | | Europe (Germany) | 595 ms | 795 ms | 100% | | South America (São Paulo) | 590 ms | 652 ms | 100% | | US (Central) | 229 ms | 720 ms | 100% | Source: https://llmlatency.dev/provider/deepinfra --- # deepseek — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the deepseek API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 168 ms | 232 ms | 100% | | Europe (Germany) | 299 ms | 498 ms | 99% | | South America (São Paulo) | 426 ms | 457 ms | 100% | | US (Central) | 307 ms | 355 ms | 100% | Source: https://llmlatency.dev/provider/deepseek --- # doubao — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the doubao API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 389 ms | 1110 ms | 100% | | Europe (Germany) | 358 ms | 827 ms | 100% | | South America (São Paulo) | 682 ms | 1582 ms | 100% | | US (Central) | 481 ms | 1210 ms | 100% | Source: https://llmlatency.dev/provider/doubao --- # ernie — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the ernie API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 138 ms | 143 ms | 100% | | Europe (Germany) | 280 ms | 285 ms | 100% | | South America (São Paulo) | 410 ms | 419 ms | 100% | | US (Central) | 271 ms | 277 ms | 100% | Source: https://llmlatency.dev/provider/ernie --- # featherless — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the featherless API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 511 ms | 4040 ms | 100% | | Europe (Germany) | 701 ms | 1199 ms | 100% | | South America (São Paulo) | 756 ms | 3520 ms | 99% | | US (Central) | 365 ms | 2798 ms | 100% | Source: https://llmlatency.dev/provider/featherless --- # fireworks — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the fireworks API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 10 ms | 42 ms | 100% | | Europe (Germany) | 98 ms | 201 ms | 100% | | South America (São Paulo) | 263 ms | 285 ms | 100% | | US (Central) | 25 ms | 63 ms | 100% | Source: https://llmlatency.dev/provider/fireworks --- # friendli — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the friendli API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 191 ms | 256 ms | 100% | | Europe (Germany) | 200 ms | 395 ms | 100% | | South America (São Paulo) | 193 ms | 322 ms | 100% | | US (Central) | 80 ms | 248 ms | 100% | Source: https://llmlatency.dev/provider/friendli --- # glm — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the glm API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 348 ms | 385 ms | 100% | | Europe (Germany) | 801 ms | 1401 ms | 100% | | South America (São Paulo) | 650 ms | 657 ms | 100% | | US (Central) | 387 ms | 428 ms | 100% | Source: https://llmlatency.dev/provider/glm --- # google — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the google API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 55 ms | 80 ms | 100% | | Europe (Germany) | 98 ms | 199 ms | 100% | | South America (São Paulo) | 154 ms | 644 ms | 100% | | US (Central) | 36 ms | 93 ms | 100% | Source: https://llmlatency.dev/provider/google --- # groq — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the groq API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 144 ms | 188 ms | 100% | | Europe (Germany) | 296 ms | 401 ms | 100% | | South America (São Paulo) | 227 ms | 255 ms | 100% | | US (Central) | 116 ms | 169 ms | 100% | Source: https://llmlatency.dev/provider/groq --- # hunyuan — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the hunyuan API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 1120 ms | 1149 ms | 100% | | Europe (Germany) | 1544 ms | 2314 ms | 100% | | South America (São Paulo) | 1655 ms | 1671 ms | 100% | | US (Central) | 1379 ms | 1387 ms | 100% | Source: https://llmlatency.dev/provider/hunyuan --- # hyperbolic — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the hyperbolic API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 493 ms | 550 ms | 100% | | Europe (Germany) | 301 ms | 798 ms | 100% | | South America (São Paulo) | 786 ms | 866 ms | 100% | | US (Central) | 170 ms | 282 ms | 100% | Source: https://llmlatency.dev/provider/hyperbolic --- # iflytek — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the iflytek API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 244 ms | 855 ms | 100% | | Europe (Germany) | 298 ms | 750 ms | 100% | | South America (São Paulo) | 642 ms | 1549 ms | 100% | | US (Central) | 431 ms | 2236 ms | 99% | Source: https://llmlatency.dev/provider/iflytek --- # inference-net — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the inference-net API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 363 ms | 986 ms | 100% | | Europe (Germany) | 198 ms | 900 ms | 100% | | South America (São Paulo) | 307 ms | 1051 ms | 100% | | US (Central) | 161 ms | 199 ms | 100% | Source: https://llmlatency.dev/provider/inference-net --- # kimi — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the kimi API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 126 ms | 163 ms | 100% | | Europe (Germany) | 299 ms | 401 ms | 100% | | South America (São Paulo) | 338 ms | 369 ms | 100% | | US (Central) | 265 ms | 333 ms | 100% | Source: https://llmlatency.dev/provider/kimi --- # meta-llama — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the meta-llama API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 127 ms | 344 ms | 100% | | Europe (Germany) | 100 ms | 299 ms | 100% | | South America (São Paulo) | 222 ms | 246 ms | 100% | | US (Central) | 49 ms | 110 ms | 100% | Source: https://llmlatency.dev/provider/meta-llama --- # minimax — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the minimax API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 195 ms | 241 ms | 100% | | Europe (Germany) | 302 ms | 500 ms | 100% | | South America (São Paulo) | 452 ms | 491 ms | 100% | | US (Central) | 322 ms | 356 ms | 100% | Source: https://llmlatency.dev/provider/minimax --- # mistral — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the mistral API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 307 ms | 353 ms | 100% | | Europe (Germany) | 100 ms | 202 ms | 100% | | South America (São Paulo) | 250 ms | 293 ms | 100% | | US (Central) | 175 ms | 244 ms | 100% | Source: https://llmlatency.dev/provider/mistral --- # nebius — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the nebius API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 550 ms | 598 ms | 100% | | Europe (Germany) | 99 ms | 204 ms | 100% | | South America (São Paulo) | 457 ms | 481 ms | 100% | | US (Central) | 218 ms | 288 ms | 100% | Source: https://llmlatency.dev/provider/nebius --- # novita — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the novita API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 144 ms | 168 ms | 100% | | Europe (Germany) | 298 ms | 500 ms | 100% | | South America (São Paulo) | 235 ms | 273 ms | 100% | | US (Central) | 66 ms | 126 ms | 100% | Source: https://llmlatency.dev/provider/novita --- # nscale — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the nscale API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 457 ms | 490 ms | 100% | | Europe (Germany) | 97 ms | 195 ms | 100% | | South America (São Paulo) | 407 ms | 409 ms | 100% | | US (Central) | 196 ms | 210 ms | 100% | Source: https://llmlatency.dev/provider/nscale --- # openai — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the openai API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 205 ms | 261 ms | 100% | | Europe (Germany) | 294 ms | 495 ms | 100% | | South America (São Paulo) | 215 ms | 386 ms | 100% | | US (Central) | 117 ms | 206 ms | 100% | Source: https://llmlatency.dev/provider/openai --- # openrouter — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the openrouter API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 52 ms | 87 ms | 100% | | Europe (Germany) | 98 ms | 198 ms | 100% | | South America (São Paulo) | 55 ms | 67 ms | 100% | | US (Central) | 58 ms | 114 ms | 100% | Source: https://llmlatency.dev/provider/openrouter --- # perplexity — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the perplexity API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 227 ms | 574 ms | 100% | | Europe (Germany) | 206 ms | 402 ms | 100% | | South America (São Paulo) | 201 ms | 250 ms | 100% | | US (Central) | 102 ms | 145 ms | 100% | Source: https://llmlatency.dev/provider/perplexity --- # qwen — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the qwen API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 190 ms | 248 ms | 100% | | Europe (Germany) | 398 ms | 501 ms | 100% | | South America (São Paulo) | 712 ms | 805 ms | 100% | | US (Central) | 437 ms | 491 ms | 100% | Source: https://llmlatency.dev/provider/qwen --- # reka — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the reka API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 288 ms | 980 ms | 100% | | Europe (Germany) | 100 ms | 298 ms | 100% | | South America (São Paulo) | 264 ms | 668 ms | 100% | | US (Central) | 198 ms | 474 ms | 100% | Source: https://llmlatency.dev/provider/reka --- # replicate — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the replicate API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 175 ms | 470 ms | 100% | | Europe (Germany) | 201 ms | 498 ms | 100% | | South America (São Paulo) | 193 ms | 473 ms | 100% | | US (Central) | 81 ms | 133 ms | 100% | Source: https://llmlatency.dev/provider/replicate --- # sambanova — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the sambanova API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 20 ms | 58 ms | 100% | | Europe (Germany) | 395 ms | 498 ms | 100% | | South America (São Paulo) | 412 ms | 429 ms | 99% | | US (Central) | 149 ms | 183 ms | 100% | Source: https://llmlatency.dev/provider/sambanova --- # sarvam — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the sarvam API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 245 ms | 261 ms | 100% | | Europe (Germany) | 296 ms | 308 ms | 100% | | South America (São Paulo) | 600 ms | 626 ms | 100% | | US (Central) | 433 ms | 463 ms | 100% | Source: https://llmlatency.dev/provider/sarvam --- # sensenova — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the sensenova API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 290 ms | 756 ms | 100% | | Europe (Germany) | 390 ms | 1035 ms | 100% | | South America (São Paulo) | 612 ms | 671 ms | 100% | | US (Central) | 421 ms | 1064 ms | 100% | Source: https://llmlatency.dev/provider/sensenova --- # siliconflow — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the siliconflow API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 382 ms | 402 ms | 100% | | Europe (Germany) | 296 ms | 394 ms | 100% | | South America (São Paulo) | 274 ms | 285 ms | 100% | | US (Central) | 82 ms | 100 ms | 100% | Source: https://llmlatency.dev/provider/siliconflow --- # stepfun — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the stepfun API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 302 ms | 763 ms | 100% | | Europe (Germany) | 435 ms | 1105 ms | 100% | | South America (São Paulo) | 659 ms | 711 ms | 100% | | US (Central) | 419 ms | 1064 ms | 100% | Source: https://llmlatency.dev/provider/stepfun --- # targon — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the targon API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 321 ms | 334 ms | 100% | | Europe (Germany) | 303 ms | 362 ms | 100% | | South America (São Paulo) | 322 ms | 329 ms | 100% | | US (Central) | 90 ms | 99 ms | 100% | Source: https://llmlatency.dev/provider/targon --- # together — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the together API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 186 ms | 373 ms | 100% | | Europe (Germany) | 297 ms | 500 ms | 100% | | South America (São Paulo) | 258 ms | 714 ms | 100% | | US (Central) | 129 ms | 183 ms | 100% | Source: https://llmlatency.dev/provider/together --- # upstage — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the upstage API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 60 ms | 80 ms | 100% | | Europe (Germany) | 548 ms | 855 ms | 100% | | South America (São Paulo) | 606 ms | 646 ms | 100% | | US (Central) | 317 ms | 336 ms | 100% | Source: https://llmlatency.dev/provider/upstage --- # writer — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the writer API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 241 ms | 272 ms | 100% | | Europe (Germany) | 294 ms | 400 ms | 100% | | South America (São Paulo) | 240 ms | 273 ms | 100% | | US (Central) | 133 ms | 166 ms | 100% | Source: https://llmlatency.dev/provider/writer --- # xai — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the xai API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 174 ms | 740 ms | 100% | | Europe (Germany) | 298 ms | 806 ms | 100% | | South America (São Paulo) | 345 ms | 960 ms | 100% | | US (Central) | 136 ms | 846 ms | 100% | Source: https://llmlatency.dev/provider/xai --- # yi-01ai — AI API latency & reliability by region Updated July 23, 2026. Edge latency and uptime of the yi-01ai API measured from each region. | Region | p50 TTFB | p95 | Uptime | | --- | --- | --- | --- | | Asia (Tokyo) | 334 ms | 821 ms | 99% | | Europe (Germany) | 319 ms | 401 ms | 100% | | South America (São Paulo) | 494 ms | 525 ms | 100% | | US (Central) | 364 ms | 996 ms | 100% | Source: https://llmlatency.dev/provider/yi-01ai --- # AI model deprecation & migration calendar Updated July 23, 2026. Verified from official provider docs — nothing estimated. ## Upcoming retirements | Provider | Model | Retires | Migrate to | Source | | --- | --- | --- | --- | --- | | OpenAI | computer-use-preview-2025-03-11 | 2026-07-23 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-mini-search-preview-2025-03-11 | 2026-07-23 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-mini-tts-2025-03-20 | 2026-07-23 | gpt-4o-mini-tts-2025-12-15 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-search-preview-2025-03-11 | 2026-07-23 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5-chat-latest | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5-codex | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5.1-chat-latest | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5.1-codex | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5.1-codex-max | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5.1-codex-mini | 2026-07-23 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-audio-mini-2025-10-06 | 2026-07-23 | gpt-audio-1.5 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-realtime-mini-2025-10-06 | 2026-07-23 | gpt-realtime-2.1-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | o3-deep-research-2025-06-26 | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | o4-mini-deep-research-2025-06-26 | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5.2-codex | 2026-07-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | Mistral | Mistral Small 3.2 | 2026-07-31 | Mistral Small 4 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Devstral 2 | 2026-07-31 | Mistral Medium 3.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Magistral Medium 1.2 | 2026-07-31 | Mistral Medium 3.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Magistral Small 1.2 | 2026-07-31 | Mistral Small 4 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Mistral Nemo 12B | 2026-07-31 | Ministral 3 8B | https://docs.mistral.ai/getting-started/models/models_overview/ | | Anthropic | claude-opus-4-1-20250805 | 2026-08-05 | claude-opus-4-8 | https://docs.anthropic.com/en/docs/about-claude/model-deprecations | | OpenAI | gpt-5.2-chat-latest | 2026-08-10 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5.3-chat-latest | 2026-08-10 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | Assistants API | 2026-08-26 | Responses API and Conversations API | https://developers.openai.com/api/docs/deprecations | | Mistral | Mistral Medium 3.1 | 2026-08-31 | Mistral Medium 3.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Mistral Medium 3 | 2026-08-31 | Mistral Medium 3.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | OpenAI | Videos API | 2026-09-24 | — | https://developers.openai.com/api/docs/deprecations | | OpenAI | sora-2 | 2026-09-24 | — | https://developers.openai.com/api/docs/deprecations | | OpenAI | sora-2-pro | 2026-09-24 | — | https://developers.openai.com/api/docs/deprecations | | OpenAI | sora-2-2025-10-06 | 2026-09-24 | — | https://developers.openai.com/api/docs/deprecations | | OpenAI | sora-2-2025-12-08 | 2026-09-24 | — | https://developers.openai.com/api/docs/deprecations | | OpenAI | sora-2-pro-2025-10-06 | 2026-09-24 | — | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-3.5-turbo-instruct | 2026-09-28 | gpt-5.4-mini or gpt-5-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | babbage-002 | 2026-09-28 | gpt-5.4-mini or gpt-5-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | davinci-002 | 2026-09-28 | gpt-5.4-mini or gpt-5-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-3.5-turbo-1106 | 2026-09-28 | gpt-5.4-mini or gpt-5-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-3.5-turbo-0125 | 2026-10-23 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4-0613 | 2026-10-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4-turbo | 2026-10-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4.1-nano | 2026-10-23 | gpt-5.6-luna | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-2024-05-13 | 2026-10-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-image-1 | 2026-10-23 | gpt-image-2 | https://developers.openai.com/api/docs/deprecations | | OpenAI | o1-2024-12-17 | 2026-10-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | o1-pro-2025-03-19 | 2026-10-23 | gpt-5.6-sol (reasoning.mode: pro) | https://developers.openai.com/api/docs/deprecations | | OpenAI | o3-mini-2025-01-31 | 2026-10-23 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | ft-o4-mini-2025-04-16 | 2026-10-23 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | o4-mini-2025-04-16 | 2026-10-23 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | ft-gpt-3.5-turbo | 2026-10-23 | gpt-5.4-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | ft-gpt-4 | 2026-10-23 | gpt-5.5 | https://developers.openai.com/api/docs/deprecations | | OpenAI | ft-gpt-4.1-nano-2025-04-14 | 2026-10-23 | gpt-5.4-nano | https://developers.openai.com/api/docs/deprecations | | OpenAI | ft-babbage-002 | 2026-10-23 | gpt-5.4-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | ft-davinci-002 | 2026-10-23 | gpt-5.4-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-image-1-mini | 2026-12-01 | gpt-image-2 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-image-1.5 | 2026-12-01 | gpt-image-2 | https://developers.openai.com/api/docs/deprecations | | OpenAI | chatgpt-image-latest | 2026-12-01 | gpt-image-2 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5-2025-08-07 | 2026-12-11 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5-mini-2025-08-07 | 2026-12-11 | gpt-5.6-terra | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5-nano-2025-08-07 | 2026-12-11 | gpt-5.6-luna | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-5-pro-2025-10-06 | 2026-12-11 | gpt-5.6-sol (reasoning.mode: pro) | https://developers.openai.com/api/docs/deprecations | | OpenAI | o3-2025-04-16 | 2026-12-11 | gpt-5.6-sol | https://developers.openai.com/api/docs/deprecations | | OpenAI | o3-pro-2025-06-10 | 2026-12-11 | gpt-5.6-sol (reasoning.mode: pro) | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-realtime | 2027-01-20 | gpt-realtime-2.1 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-audio | 2027-01-20 | gpt-audio-1.5 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-audio | 2027-01-20 | gpt-audio-1.5 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-realtime | 2027-01-20 | gpt-realtime-2.1 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-realtime-mini | 2027-01-20 | gpt-realtime-2.1-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-audio-mini | 2027-01-20 | gpt-audio-1.5 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-mini-realtime | 2027-01-20 | gpt-realtime-2.1-mini | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-mini-audio | 2027-01-20 | gpt-audio-1.5 | https://developers.openai.com/api/docs/deprecations | | OpenAI | gpt-4o-mini-transcribe-2025-03-20 | 2027-01-20 | gpt-4o-mini-transcribe-2025-12-15 | https://developers.openai.com/api/docs/deprecations | | Azure OpenAI | gpt-4o | 2027-10-01 | — | https://learn.microsoft.com/en-us/azure/ai-services/openai/concepts/model-retirements | | Azure OpenAI | gpt-4o-mini | 2027-10-01 | — | https://learn.microsoft.com/en-us/azure/ai-services/openai/concepts/model-retirements | | Azure OpenAI | gpt-4.1 | 2027-10-14 | — | https://learn.microsoft.com/en-us/azure/ai-services/openai/concepts/model-retirements | | Azure OpenAI | gpt-4.1-mini | 2027-10-14 | — | https://learn.microsoft.com/en-us/azure/ai-services/openai/concepts/model-retirements | | Azure OpenAI | gpt-4.1-nano | 2027-10-14 | — | https://learn.microsoft.com/en-us/azure/ai-services/openai/concepts/model-retirements | ## Recently retired | Provider | Model | Retires | Migrate to | Source | | --- | --- | --- | --- | --- | | Anthropic | claude-mythos-preview | 2026-07-21 | claude-mythos-5 | https://docs.anthropic.com/en/docs/about-claude/model-deprecations | | Mistral | Leanstral | 2026-06-30 | Leanstral 1.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Mistral Moderation | 2026-06-30 | Mistral Moderation 2 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Anthropic | claude-opus-4-20250514 | 2026-06-15 | claude-opus-4-8 | https://docs.anthropic.com/en/docs/about-claude/model-deprecations | | Anthropic | claude-sonnet-4-20250514 | 2026-06-15 | claude-sonnet-4-6 | https://docs.anthropic.com/en/docs/about-claude/model-deprecations | | Mistral | Voxtral Mini | 2026-05-31 | Voxtral Mini Transcribe 2 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Devstral Medium 1.0 | 2026-05-31 | Mistral Medium 3.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Devstral Small 1.1 | 2026-05-31 | Mistral Small 4 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | OCR 2 | 2026-05-31 | OCR 4 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Mistral Large 2.1 | 2026-05-31 | Mistral Medium 3.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | Mistral | Pixtral Large | 2026-05-31 | Mistral Medium 3.5 | https://docs.mistral.ai/getting-started/models/models_overview/ | | OpenAI | dall-e-2 | 2026-05-12 | gpt-image-2, gpt-image-1, or gpt-image-1-mini | https://developers.openai.com/api/docs/deprecations | Source: https://llmlatency.dev/deprecations