# Fastest AI API from Asia (Tokyo)
Updated July 23, 2026. Independent, provider-neutral edge latency (TTFB) and uptime by provider, measured from Asia (Tokyo), updated automatically.

As of July 23, 2026, measured from Asia (Tokyo), the fastest AI inference API by edge latency (time-to-first-byte) is **fireworks** at 10 ms p50 (n=64).

## Edge latency (time-to-first-byte)
| # | Provider | p50 | p95 | Uptime | Samples |
| --- | --- | --- | --- | --- | --- |
| 1 | fireworks | 10 ms | 39 ms | 100% | 64 |
| 2 | sambanova | 20 ms | 67 ms | 100% | 41 |
| 3 | openrouter | 52 ms | 84 ms | 100% | 64 |
| 4 | google | 55 ms | 78 ms | 100% | 64 |
| 5 | upstage | 60 ms | 80 ms | 100% | 41 |
| 6 | kimi | 123 ms | 168 ms | 100% | 46 |
| 7 | meta-llama | 127 ms | 332 ms | 100% | 41 |
| 8 | ernie | 139 ms | 143 ms | 100% | 41 |
| 9 | groq | 146 ms | 191 ms | 100% | 64 |
| 10 | novita | 146 ms | 168 ms | 100% | 41 |
| 11 | baseten | 156 ms | 168 ms | 100% | 41 |
| 12 | cohere | 166 ms | 193 ms | 100% | 64 |
| 13 | deepseek | 168 ms | 240 ms | 100% | 64 |
| 14 | replicate | 175 ms | 388 ms | 100% | 41 |
| 15 | xai | 176 ms | 840 ms | 100% | 64 |
| 16 | together | 185 ms | 375 ms | 100% | 64 |
| 17 | baichuan | 188 ms | 615 ms | 98% | 41 |
| 18 | friendli | 193 ms | 419 ms | 100% | 41 |
| 19 | minimax | 194 ms | 236 ms | 100% | 46 |
| 20 | qwen | 194 ms | 484 ms | 100% | 46 |
| 21 | cerebras | 202 ms | 253 ms | 100% | 64 |
| 22 | openai | 210 ms | 272 ms | 100% | 64 |
| 23 | perplexity | 225 ms | 578 ms | 100% | 41 |
| 24 | sarvam | 242 ms | 261 ms | 100% | 41 |
| 25 | writer | 244 ms | 288 ms | 100% | 41 |
| 26 | anthropic | 246 ms | 466 ms | 100% | 64 |
| 27 | reka | 288 ms | 980 ms | 100% | 41 |
| 28 | sensenova | 298 ms | 1044 ms | 100% | 41 |
| 29 | ai21 | 300 ms | 394 ms | 100% | 41 |
| 30 | mistral | 307 ms | 370 ms | 100% | 64 |
| 31 | stepfun | 309 ms | 779 ms | 100% | 41 |
| 32 | targon | 321 ms | 333 ms | 100% | 41 |
| 33 | iflytek | 337 ms | 929 ms | 100% | 41 |
| 34 | glm | 352 ms | 386 ms | 100% | 46 |
| 35 | yi-01ai | 352 ms | 911 ms | 98% | 41 |
| 36 | inference-net | 363 ms | 1099 ms | 100% | 41 |
| 37 | siliconflow | 382 ms | 402 ms | 100% | 41 |
| 38 | doubao | 401 ms | 1136 ms | 100% | 41 |
| 39 | nscale | 486 ms | 490 ms | 100% | 41 |
| 40 | hyperbolic | 493 ms | 551 ms | 100% | 41 |
| 41 | deepinfra | 507 ms | 684 ms | 100% | 41 |
| 42 | featherless | 517 ms | 4040 ms | 100% | 41 |
| 43 | nebius | 550 ms | 598 ms | 100% | 41 |
| 44 | aleph-alpha | 573 ms | 594 ms | 100% | 41 |
| 45 | hunyuan | 1122 ms | 1148 ms | 100% | 41 |


Source: https://llmlatency.dev/region/ap-tokyo