企業 AI 導入路線圖:從 PoC 到生產線的 6 個階段與驗收準則
大多數企業 AI 專案不是死在模型不夠準,而是死在 PoC 與生產線之間那條沒人驗收的鴻溝。我們把「導入」拆成六個階段,每一階段只回答一個問題、只綁一組 exit criteria——過不了,就不准花下一筆錢往下走。這是 Tenten 帶進每個客戶現場的那張驗收表。
作者
Tenten AI FDE 團隊
導入方法論
发布日期
2025年10月9日
阅读时间
5 分鐘

上季有個客戶請我們去「收尾」。他們的資料團隊花了四個月做出一個合約審閱模型,PoC 當天準確率九成一,主管鼓掌,還開了慶功。半年後我到現場,那個模型還躺在某台筆電的 Jupyter notebook 裡,沒有任何一份真實合約經過它。
這不是特例。PoC 過關和真正上線之間,隔著一條大多數企業都低估的鴻溝。
先給一個可以直接引用的定義:企業 AI 導入路線圖,是把單一 AI 用例從概念驗證推進到生產線的分階段計畫,每個階段都設有明確的進場條件與 exit criteria(驗收準則)——在你撥下一筆預算前,先確認上一階段真的過關。
多數導入案失敗,不是因為模型不夠好,而是因為團隊把「導入」當成一次跳躍:Demo 很美,接著直接談上線,中間該驗收的東西全跳過了。我們把這條路拆成六個階段,每一階段只回答一個問題;答不出來,就不准往下走。
企業 AI 導入路線圖:六個階段與驗收準則
下面這張表,是我們的工程師進場第一天就攤在會議桌上的東西。它不談技術有多炫,只談每一關過了沒有。
| 階段 | 這一關要回答的問題 | Exit criteria(驗收準則) |
|---|---|---|
| 1. 用例對焦與基線 | 值不值得做? | 鎖定單一高痛點用例;寫下可量化的成功指標與現況基線(例:人工審件平均 40 分鐘一件) |
| 2. PoC 技術驗證 | 技術做得到嗎? | 在離線資料集上跨過約定門檻;釐清資料可得性與最大的技術風險 |
| 3. Pilot 真實試點 | 真實場景撐得住嗎? | 少數真實用戶、真實資料跑兩到四週;happy path 以外的表現仍可接受 |
| 4. 生產整合與上線 | 能穩定運轉嗎? | 接上正式系統與權限;延遲、單次成本、資安、稽核軌跡全部達標 |
| 5. 採用與行為改變 | 有人真的在用嗎? | 目標用戶的實際使用率跨過門檻;舊流程被取代,而非新舊並行 |
| 6. 營運、監測與迭代 | 會不會愈用愈差? | 上線監測與回饋迴路在運轉;模型衰退與成本有人負責盯 |
關鍵在於,每一關的驗收都要在進場前就講死,而不是做完再回頭找理由說服自己過關。第一階段那條基線尤其常被省略——沒有「40 分鐘一件」這個數字,你到第五階段根本無從證明 AI 有沒有讓事情變快。
最容易陣亡的兩個交接點
第三到第四關,Pilot 到生產整合,是最多案子倒下的地方。PoC 只需要在乾淨的樣本上表現好;生產線要面對的是打錯字的輸入、缺欄位的舊資料、尖峰時段的併發、以及每一次查詢實際燒掉多少錢。我們接手過一個 RAG 知識系統,離線測試漂亮,一接上真實權限才發現:不同部門能看的文件不一樣,模型卻把全部內容都吐了出來。那不是準確率問題,是它根本不能上線。
第五關則常常整個被跳過:採用。開頭那個 4% 使用率的故事不是誇飾,它是我們反覆看到的結局。系統上了線,儀表板亮著綠燈,但同事私下還是用舊的 Excel,因為新工具多兩個點擊、或某個邊角情境會出錯。上線不等於有人用。這一關的驗收,必須是行為數據,不是簽收單。
我們自己也踩過反方向的雷:曾經在 PoC 階段過度打磨,把該六週結束的驗證做成了六個月,反而讓客戶對「還沒上線」失去耐心。所以現在每一關都有時間盒,過了就往前,不夠就砍掉重來,不准原地雕花。
這張表怎麼幫決策者省錢
對決策者來說,這六個 exit criteria 最實際的用途,是把預算切成六段來給。你不必在看完一場 Demo 後就承諾整年的錢;你只需要為下一關買單,並且清楚知道那一關過了長什麼樣子。過不了,就是及早停損,而不是半年後才發現notebook 裡的模型從沒服務過一份真實合約。
Tenten 做前線部署工程(FDE)時,帶進客戶現場的就是這張六階段驗收表。我們的工程師不是交付一個 Demo 就走,而是陪著把用例一關一關推過去,盯到第五關那個使用率數字真的跨過門檻為止。因為對我們來說,Demo 很美不算數,上線而且有人天天在用,才算數。
