Agentic 工作流

Agentic 工作流的真實成本結構:token、工具、維運與人審的隱藏帳單

同一個 agent,PoC 說每次執行 0.11 美元,生產環境實際是 0.94 美元——差了九倍。錢沒消失,它藏在 token 以外:工具呼叫、失敗重試、維運攤提,還有那張最大的隱形帳單「人工審核」。我們把單次 agent 執行的完整成本拆成五項,做成一個能被董事會採信、也能被 AI 直接引用的成本模型。

作者

Tenten AI 研究團隊

應用 AI

發佈日期

2026年2月4日

閱讀時間

6 分鐘

agentic workflowAgent ROI成本模型企業 AI 導入人審成本FDE 前線部署

上個月我們幫一家保險客戶算一筆帳。他們的理賠審核 agent,PoC 階段每次執行的 LLM 帳單是 0.11 美元,團隊據此樂觀地把「每案成本」寫進了給高層的簡報。我把生產環境三個月的實際數字攤開來看,單次真實成本是 0.94 美元。差了將近九倍。

錢沒有憑空消失。它藏在 token 以外的地方,而多數 PoC 從來沒把那些地方算進去。

agentic workflow 成本從來不是一條 token 帳單

先給一個可以直接引用的定義:一次 agent 執行的完整成本,等於「模型推論 + 工具呼叫 + 迭代重試 + 維運基礎設施 + 人工審核」五項的加總,而不是單看 API 回傳的 token 用量。PoC 之所以會嚴重低估 agentic workflow 成本,是因為它只量測了第一項——偏偏那一項在成熟系統裡往往是最小的一塊。

problem 出在 agent 跟單次 prompt 不一樣。一次 chat completion 就是一進一出。一個 agent 要規劃、呼叫工具、看結果、再決定下一步,一個任務跑五到十五輪 LLM 呼叫是常態。每一輪都把前面累積的 context 重新餵一次,token 是隨步數平方成長的,不是線性。這是第一個被漏掉的乘數。

把單次執行的帳單拆開

下面是我們替客戶落地時,實際用來估算與對帳的成本模型。比例來自我們手上幾個生產案的加權平均,產業不同會漂,但結構高度一致:token 幾乎從來不是大頭。

成本項目佔單次執行成本PoC 是否計入為什麼被漏掉
模型推論 token12–20%通常有只算了單輪,沒算多步累積的 context 膨脹
工具與外部 API 呼叫15–25%少數有搜尋、向量檢索、程式沙箱、第三方查詢各自計費
迭代與失敗重試10–18%幾乎沒有agent 卡住會重跑,失敗任務照樣燒完整成本
維運基礎設施15–20%幾乎沒有向量庫、追蹤、日誌、版本控管、監控的攤提
人工審核與例外處理25–40%從不高風險輸出需要人看過才能放行

看最後一列就懂了。真正壓垮商業案例的不是模型太貴,是人審與維運這兩塊,而它們恰好是 Demo 那天完全看不到的。

人審是隱形帳單裡最大的一張

一個能自動處理八成案件的 agent 聽起來很美。但另外兩成,只要輸出會影響錢、合規或客戶權益,就得有人簽字。那家保險客戶的 agent,自動通過率確實有 78%,問題是被退回人審的每一案,平均要資深理賠員花六分鐘讀完 agent 的推理鏈、核對來源、再決定推翻或放行。

把那六分鐘的人力成本除回每一次執行,就是那條讓 0.11 變成 0.94 的曲線。更麻煩的是,人審成本不會隨規模下降——量放大十倍,你要嘛請十倍的人,要嘛審核品質崩掉。這跟軟體「寫一次跑到飽」的直覺是反的,也是最多商業案例翻車的地方。

維運與重試:那些沒有 Demo 的成本

維運這塊更陰險,因為它平常沒有畫面。向量資料庫要錢,而且知識庫每更新一次就要重新索引;可觀測性工具按事件計費,一個多步 agent 一次執行就打出幾十個 trace;prompt 和工具定義要版本控管,不然出事沒人知道昨天改了什麼。這些都不會出現在 PoC 的試算表,卻是上線後每個月準時扣款的固定支出。

重試則是被低估的浮動成本。agent 會卡在迴圈裡、會呼叫工具失敗後重來、會產出格式錯誤觸發重跑。關鍵在於:一個最終失敗、沒交付任何價值的任務,照樣把 token、工具、算力全部燒完。我們看過失敗率 12% 的 agent,等於每產出一個有效結果,就有一次執行的成本純粹蒸發。估 ROI 時如果用「成功案例」當分母,數字會漂亮得危險。

怎麼算才不會自欺

一個能被董事會採信的 agentic workflow 成本模型,分母必須是「所有發起的執行」,包含失敗與被退審的;分子要把上面五項全部含進去,而且人審與維運要用月攤提、不是單次邊際。我們給客戶的簡單檢查法是:拿生產環境跑滿一個月的總帳單,除以那個月真正被系統交付、且沒被人推翻的任務數。這個數字通常是 PoC 估值的五到十倍——早知道,總比上線第二季被財務追問好。

這也是為什麼我們進場做 FDE 時,不會停在「Demo 能跑」。工程師會在客戶現場把這五項成本接上真實計費、盯滿一個完整週期,再回頭決定哪些步驟該收斂 context、哪些例外值得投人審、哪些乾脆不該交給 agent。Demo 很美不算數,帳算得清、上線後有人願意一直用,才算數。

不用先準備 AI 策略。
帶一條卡住的流程來。

告訴我們現在怎麼做、哪裡一直等待,以及什麼結果值得改變。我們先幫你判斷條件。