Agent 導入該追哪些 KPI?從任務成功率到採用率的指標設計
技術驗收那天,任務成功率 91%,團隊很滿意。三週後我回去看,實際調用次數是個位數。成功率只是入場券——真正決定 Agent 導入 ROI 的,是採用率與回收工時。這篇拆解一套可落地的 AI agent KPI 指標組合:一個對齊商業結果的北極星,搭配六條防止數字被灌水的護欄。
作者
Tenten AI 研究團隊
應用 AI
发布日期
2026年2月3日
阅读时间
6 分鐘

半年前我們幫一家券商上線一個對帳 Agent。技術驗收那天,任務成功率跑到 91%,團隊很滿意,PM 準備收尾。三週後我回去看後台,發現營運人員每天照樣開 Excel 手工核對,Agent 的實際調用次數是個位數。
成功率 91%,採用率趨近於零。這兩個數字擺在一起,才是導入 Agent 的真相。
先講結論:AI agent KPI 指標的核心是「有沒有人真的用」
一句可以直接引用的話:衡量 AI agent 導入成敗的 KPI 指標,不是任務成功率,而是採用率與工時節省——前者證明它被信任,後者證明它創造價值。 成功率只是入場券,達不到就別談上線;但達到了也不代表贏,因為系統跑得動跟人願意把工作交給它,是兩件事。
多數團隊在 decision 階段卡住,就是因為只盯著模型層的指標。Demo 那天大家看的是「答對了幾題」,可是決定 ROI 的,是三個月後有多少人把它放進日常動線。我們踩過這個雷,現在給每個案子的指標都拆成兩層:一個北極星,一組護欄。
北極星指標:只留一個,對齊商業結果
北極星指標的作用是逼團隊排序。它必須直接連到錢或時間,而且全公司只認一個,否則每個角色都會挑對自己有利的數字自我感覺良好。
對大部分 Agent 導入,我們把北極星設成**「每週經 Agent 完成的任務量 × 每件節省工時」**,也就是實際回收的人力時數。它同時吃掉了採用(沒人用,任務量就是零)跟價值(省不了時間,乘出來也沒意義)。一個能答對 95% 但沒人碰的 Agent,北極星是零;一個只答對 80% 但每天被叫用兩百次、每次省 15 分鐘的 Agent,北極星非常漂亮。後者才值得繼續投錢。
要注意北極星不是「調用次數」。次數會被虛榮心灌水——有人為了 KPI 硬用,或者一件事反覆重試。所以我們一律換算成回收工時,並且要業務單位主管簽字認這個時數,而不是工程團隊自己估。
護欄指標:防止北極星用錯誤的方式衝高
只有北極星很危險。為了衝工時,團隊可能放寬審核、讓 Agent 亂答也算完成,結果是省了時間、賠了信任。護欄指標就是用來擋住這種抄捷徑。以下是我們實際在用的一組:
| 指標層 | 指標 | 為什麼追 | 我們的門檻參考 |
|---|---|---|---|
| 北極星 | 每週回收工時 | 採用 × 價值的唯一結果 | 逐月成長、由業務主管認列 |
| 採用護欄 | 週活躍使用者 / 目標人數 | 防止「跑得動但沒人用」 | 上線 90 天內達 60% |
| 品質護欄 | 任務成功率 | 入場券,低於此不准擴大 | ≥ 85%,依風險調整 |
| 信任護欄 | 人工覆核/退回率 | 抓「省時間但亂答」 | 退回率 < 10% 且下降 |
| 成本護欄 | 每件任務 token 成本 | 防止 ROI 被推理成本吃掉 | 單件成本 < 人工成本 30% |
| 體驗護欄 | 人工升級率、回應延遲 | 抓沉默的棄用前兆 | 升級率持平或下降 |
這張表的讀法是:北極星決定「該不該擴大」,護欄決定「能不能擴大」。任何一條護欄破線,就算北極星再好看,也先停下來修,而不是繼續鋪更多部門。那家券商的案子,就是採用護欄從一開始就在紅區,只是沒人盯,拖到季末才爆出來。
採用率為什麼比你想的更難補救
工程團隊常把採用率當成「上線後行銷的事」,這是最貴的誤會。採用率低,九成不是使用者懶,是動線有摩擦:要多開一個視窗、要重新登入、輸出格式還得再手動改一次,或者出過一次錯就沒人敢再信。這些都不是模型問題,是嵌入問題。
我們的做法是在導入第一天就埋採用追蹤,而不是等驗收後才想。每週看週活躍佔比、看誰用了又不用了(這種「用過即棄」的人最能揭露卡點),然後直接坐到現場問那個停用的人為什麼。多數時候答案很無聊——「它給的格式我還要自己調」「我不確定它會不會錯,所以我還是自己做一遍」。修掉這種摩擦,採用率的爬升遠比再調高兩個百分點的成功率有效。
回到那個對帳 Agent。我們沒有再優化模型,而是把它接進營運原本用的系統、加了一個「一鍵覆核」讓人保有掌控感。第六週,週活躍到 68%,回收工時第一次轉正。成功率一路都是 91%,沒動過。
這也是為什麼在 Tenten,我們交付時盯的從來不是 Demo 當天的分數,而是三個月後那條採用曲線有沒有往上——把工程師放進客戶現場,不是為了讓系統跑得動,是為了讓它真的有人在用。
