Deployment
評估漂移
讓 AI Agent 撐過第三個月——監測儀表、節奏,以及該追的指標
作者
Tenten AI Research
ML Engineering
發布日期
2026年2月20日
閱讀時間
15 min
evaluationLLM-as-judgeobservabilityproduction monitoringdrift

摘要
AI 系統會在正式環境裡慢慢退化。這是把機器學習系統放進一個不斷變動的環境後,必然要面對的結果,而非模型的瑕疵。使用者行為會變、上游資料會變、業務需求也會變。正式環境的查詢分布,會一點一滴偏離當初拿來評估系統的那份分布。
漂移本身不是最糟的事。最糟的是你沒先察覺,反而讓使用者替你發現。
多數企業 AI 團隊把資源重壓在上線前評估,卻嚴重低估了上線後的持續監控。本文主張的,恰恰是相反的配置:一套輕量的上線前評估,加上一套嚴謹的持續監控,遠比一套窮盡一切卻沒有後續監控的上線前評估更有價值。
本白皮書說明 Tenten AI 為正式環境 AI 系統所建置的評估基礎設施、能在問題被使用者看見之前就可靠偵測到退化的指標,以及在正式環境持續演變時、維持評估覆蓋率的維運節奏。
完整內容
解鎖完整白皮書
填寫你的資料後即可立即閱讀完整內容。我們每月發送一至兩封技術通訊,隨時可取消訂閱。
送出即代表你同意接收 Tenten AI 的技術通訊,可隨時退訂。
