首頁教材庫 / 系統效能與MLOps / Throughput vs Latency

iPAS AI初級 系統效能與MLOps ⏱ 約 4 分鐘讀完
iPAS AI 初級・漫畫式小白教材

吞吐量 Throughput vs 延遲 Latency

一個問「一次能處理多少?」一個問「一件事情要等多久?」

🎬 第一幕:AI 餐廳的故事

① 客人排隊
「怎麼還沒輪到我?」
🍜
👤👤👤👤

每一位客人等多久?

② 廚房很忙
「我們一分鐘
可以做 100 碗!」
👨‍🍳
🍜 × 100
/分鐘
③ 兩個不同問題
Latency:
「我等多久?」
Throughput:
「你能做多少?」

🧠 先用一句話分清楚

🚀 吞吐量 Throughput

「單位時間內,可以處理多少工作?」

關心的是系統的處理能力/產能

Throughput = 單位時間完成的工作量
每秒請求數 RPS 每秒交易數 TPS tokens/sec

例如:一個 AI 伺服器每秒可以處理 100 個請求。

⏱️ 延遲 Latency

「一個請求,從開始到完成要等多久?」

關心的是單次反應速度/等待時間

Latency = 從請求到完成所花的時間
ms 毫秒 Response Time 等待時間

例如:使用者按下按鈕後,AI 0.8 秒才回覆。

🎭 第二幕:同一台 AI,兩個不同考官

⏱️ Latency 考官

「你回答一個人,要多久?」
🧑 → 🤖 → 💬
0.8 秒

重點是單一請求的等待時間

🚀 Throughput 考官

「你 1 秒可以服務幾個人?」
🧑 🧑 🧑 🧑 🧑
100 requests / sec

重點是單位時間可以處理多少請求

🎯 所以:Latency 看「一個有多快」;Throughput 看「一段時間能做多少」。

🏢 第三幕:套進 AI 與能源管理系統

🏢 情境 A:電費單 OCR

員工上傳一張電費單,系統多久完成辨識?

上傳 → OCR → 結果
⏱️ 1.2 秒

👉 這是在關心Latency

🏢 情境 B:大量電費單批次處理

系統 1 秒可以處理幾張電費單?

📄📄📄📄📄📄
50 bills / sec

👉 這是在關心Throughput

🥊 第四幕:正面比較

比較🚀 Throughput 吞吐量⏱️ Latency 延遲
核心問題一段時間可以處理多少?一個請求要等多久?
常見單位requests/sec、TPS、tokens/secms、秒
重點系統「產能」系統「反應速度」
生活比喻餐廳每小時能出 500 份餐你的餐等 5 分鐘才送到
能源系統每秒能處理多少張電費單一張電費單多久辨識完成
考試關鍵字「每秒/每分鐘/單位時間處理量」「等待時間/反應時間/毫秒」

🎯 第五幕:為什麼兩個不能混在一起?

高 Throughput
🏭

工廠一次大量生產
1000 件/分鐘

但不代表每一件都很快完成。

低 Latency

單件反應超快
0.01 秒

但如果同時只能處理 1 個請求,產能還是低。

理想狀態
🏆

低 Latency

高 Throughput

又快,又能大量處理!

🧠 iPAS 考前超強記憶法

🚀 Throughput = 「一段時間能做多少」
⏱️ Latency = 「一件事情要等多久」

🎯 看到「每秒可以處理幾個」→ Throughput
🎯 看到「幾毫秒才回應」→ Latency

⭐ 超短口訣:
「Throughput 看,Latency 看時間。」

🎯 iPAS 模擬題

Q1:某 AI API 每秒可以處理 500 個使用者請求,這項指標主要是在描述什麼?

Throughput(吞吐量):單位時間能處理多少請求。

Q2:使用者送出 AI 問題後,系統平均需要 800 ms 才回傳結果,這項指標主要是在描述什麼?

Latency(延遲):單次請求需要等待多久。

Q3:某系統可以大量處理資料,但每一個使用者都需要等待很久。哪一項可能很好、哪一項可能不好?

Throughput 可能很高,但 Latency 可能很高。
「能大量處理」不代表「每個人都能快速得到結果」。

📌 考前最後一張小抄

看到題目關鍵字立刻想到
「每秒處理 100 個請求」🚀 Throughput
「每分鐘完成多少交易」🚀 Throughput
「TPS/RPS/tokens per second」🚀 Throughput
「回應需要 200 ms」⏱️ Latency
「使用者等待多久」⏱️ Latency
「反應時間/Response Time」⏱️ Latency

⭐ 最後只背一句:
「吞吐量問『能做多少』,延遲問『要等多久』。」