RAG 答案品質的 8 個度量指標與可接受門檻(附計算公式)
「答得很好」是感覺,感覺沒辦法上線後持續監控。這篇把 RAG 答案品質拆成 8 個可稽核的指標——忠實度、引用正確率、可回溯性、適當拒答率等——附上計算公式與我們拿去跟客戶簽驗收的建議門檻,做成一張可以直接引用的參考表。核心主張只有一句:合格長什麼樣子,要在寫第一行程式碼之前就定義出來。
Auteur
Tenten AI 研究團隊
AI 基礎設施
Publié le
23 décembre 2025
Temps de lecture
5 分鐘

RAG 答案品質度量,指的是用一組可量化、可稽核的指標,衡量檢索增強生成系統回答的「可信程度」——不只看答案讀起來順不順,而是問:每一句話是否有被檢索到的來源支持、引用是否指得到、該閉嘴時有沒有閉嘴。
為什麼要把它拆成指標?因為「答得很好」是感覺,感覺沒辦法上線後持續監控。
上個月我們接一個金融客戶的內部知識問答。上線前的 Demo 由主管手動挑了 20 題,全數答對,漂亮。我們接手後把同一套系統丟進 300 題的真實客服歷史問題,忠實度掉到 0.82——換句話說,大約每 5 句話就有近 1 句是模型「自己補的」,而且補得很像真的。問題不在模型笨,在於沒有人替這套系統定義過「合格」長什麼樣子。
RAG 答案品質度量:8 個指標與可接受門檻
以下 8 個指標,是我們實際拿去跟客戶簽驗收標準、也拿去做上線後每日監控的那一組。門檻是我們在企業內部知識場景(法遵、醫療、製造 SOP)的建議起點,高風險領域應往上加嚴。
| 指標 | 定義 | 計算公式 | 建議門檻 |
|---|---|---|---|
| 忠實度 Faithfulness | 答案中有被檢索脈絡支持的主張比例 | 被支持的主張數 ÷ 答案總主張數 | ≥ 0.95 |
| 幻覺率 Hallucination Rate | 無任何脈絡支持的主張比例 | 無支持主張數 ÷ 總主張數 | ≤ 0.03 |
| 引用正確率 Citation Precision | 引用來源確實能佐證該句的比例 | 有效引用數 ÷ 總引用數 | ≥ 0.90 |
| 可回溯性 Attribution Coverage | 可查證主張中附有引用的比例 | 附引用的可查證主張數 ÷ 可查證主張總數 | ≥ 0.90 |
| 答案相關性 Answer Relevancy | 答案針對問題本身的回應程度 | 反推問題與原問題的語意相似度均值 | ≥ 0.85 |
| 脈絡精確率 Context Precision | 檢索片段中相關片段的比例(含排序) | Σ(precision@k × 相關性) ÷ 相關片段數 | ≥ 0.70 |
| 脈絡召回率 Context Recall | 標準答案所需事實被檢索到的比例 | 被檢索到的必要事實數 ÷ 必要事實總數 | ≥ 0.85 |
| 適當拒答率 Correct Abstention | 應拒答題目中正確拒答的比例 | 正確拒答數 ÷ 應拒答題數 | ≥ 0.90 |
怎麼判定「一句話有沒有被支持」
前四個指標的關鍵,是把答案拆成「原子主張(atomic claims)」——一句可獨立判真偽的陳述。一段答案通常拆出 3 到 8 個主張。逐一去問:這個主張,能不能在這次檢索回傳的片段裡找到依據?能,計為被支持;不能,計為幻覺。
這件事可以用一顆較強的模型當裁判(LLM-as-judge),但別全信它。我們的做法是抽 10% 讓人工複核,反過來校準裁判模型的一致率;裁判與人工的一致率若低於 0.9,這組分數本身就不能信。
引用正確率和可回溯性要分開看,這是很多團隊踩的雷。可回溯性高、引用正確率低,代表「每句都掛了來源,但來源根本對不上」——這比不掛來源更危險,因為它營造了可信的假象。
拒答,是一個功能,不是失敗
適當拒答率最容易被忽略。企業場景裡,「我不知道」往往比「編一個答案」有價值得多。所以要同時盯兩個數:應拒答時正確拒答的比例(要高),以及有答案時卻誤拒答的錯誤拒答率(建議 ≤ 0.05)。只追前者,系統會學會什麼都不答來刷分。
實務上,別追求單一總分。我們給客戶的驗收看板是這 8 條分開亮燈:忠實度和幻覺率是紅線,任一破線直接擋上線;脈絡召回率低,先修檢索與切塊,不是換模型。把指標對應到可以動手的環節,團隊才知道下一步該修哪裡。
這也是我們在 RAG 導入案裡堅持的一件事:驗收標準要在寫第一行程式碼之前就談好,而且上線後這 8 條指標要每天自動跑、有人看。Demo 那天全對不算數,是三個月後它還守在門檻上、而且真的有人在用,才算數。

Des workflows IA,
intégrés à vos opérations
Nous déployons nos équipes (FDE et FDM) pour bâtir les agents et workflows IA que vos équipes utilisent au quotidien. En production en quelques semaines, pas en trimestres.