① 客人排隊
「怎麼還沒輪到我?」
🍜
👤👤👤👤
每一位客人等多久?
一個問「一次能處理多少?」一個問「一件事情要等多久?」
每一位客人等多久?
「單位時間內,可以處理多少工作?」
關心的是系統的處理能力/產能。
例如:一個 AI 伺服器每秒可以處理 100 個請求。
「一個請求,從開始到完成要等多久?」
關心的是單次反應速度/等待時間。
例如:使用者按下按鈕後,AI 0.8 秒才回覆。
重點是單一請求的等待時間。
重點是單位時間可以處理多少請求。
員工上傳一張電費單,系統多久完成辨識?
👉 這是在關心Latency。
系統 1 秒可以處理幾張電費單?
👉 這是在關心Throughput。
| 比較 | 🚀 Throughput 吞吐量 | ⏱️ Latency 延遲 |
|---|---|---|
| 核心問題 | 一段時間可以處理多少? | 一個請求要等多久? |
| 常見單位 | requests/sec、TPS、tokens/sec | ms、秒 |
| 重點 | 系統「產能」 | 系統「反應速度」 |
| 生活比喻 | 餐廳每小時能出 500 份餐 | 你的餐等 5 分鐘才送到 |
| 能源系統 | 每秒能處理多少張電費單 | 一張電費單多久辨識完成 |
| 考試關鍵字 | 「每秒/每分鐘/單位時間處理量」 | 「等待時間/反應時間/毫秒」 |
工廠一次大量生產
1000 件/分鐘
但不代表每一件都很快完成。
單件反應超快
0.01 秒
但如果同時只能處理 1 個請求,產能還是低。
低 Latency
+
高 Throughput
又快,又能大量處理!
🎯 看到「每秒可以處理幾個」→ Throughput
🎯 看到「幾毫秒才回應」→ Latency
⭐ 超短口訣:
「Throughput 看量,Latency 看時間。」
Q1:某 AI API 每秒可以處理 500 個使用者請求,這項指標主要是在描述什麼?
Q2:使用者送出 AI 問題後,系統平均需要 800 ms 才回傳結果,這項指標主要是在描述什麼?
Q3:某系統可以大量處理資料,但每一個使用者都需要等待很久。哪一項可能很好、哪一項可能不好?
| 看到題目關鍵字 | 立刻想到 |
|---|---|
| 「每秒處理 100 個請求」 | 🚀 Throughput |
| 「每分鐘完成多少交易」 | 🚀 Throughput |
| 「TPS/RPS/tokens per second」 | 🚀 Throughput |
| 「回應需要 200 ms」 | ⏱️ Latency |
| 「使用者等待多久」 | ⏱️ Latency |
| 「反應時間/Response Time」 | ⏱️ Latency |
⭐ 最後只背一句:
「吞吐量問『能做多少』,延遲問『要等多久』。」