跳至主要內容

給工程師、技術營運與 AI 產品負責人

Agent 建置實戰

做出能測、能停、能查,也有人負責的 agent。

12 個實作模組,用同一個行銷研究題目一路完成型別化模型呼叫、工具、狀態、檢索、MCP、協調、人工審查、評測與分階段上線決策。每一關都有能交給下一關繼續用的產出,不靠一段漂亮展示混過去。

打開單元 00
產出
一套有邊界的行銷研究 agent:主張能追到來源、權限寫得清楚、人工審查可中斷再恢復,另附回歸測試、營運成本模型與 go/no-go 紀錄。
投入時間
18 到 24 小時,另加總整專案
開始前先準備
需熟悉 HTTP、JSON、TypeScript、環境變數與自動化測試。實作只能使用合成資料,或已取得明確授權的非敏感資料。

基礎 → 實作 → 專案

照順序走,也可以從卡關處進場。

每一課都會做出一份成果,用可觀察的條件驗收,再把它帶到下一個決策。你可以從目前卡住的地方開始,也可以完整走完。

  1. 00AI agent 與工作流程:哪些步驟值得交給模型?用同一份研究需求比較三種實作,只留下通過驗收門檻、自治程度最低的版本。基礎 · 75 分鐘
  2. 01LLM API 與 Structured Outputs:讓程式分清成功與失敗實作客服分類器,把合法 JSON、格式遵循、模型拒絕、截斷、逾時與應用程式驗證視為不同狀態。實作 · 105 分鐘
  3. 02工具呼叫:模型提案,應用程式決定是否執行只給模型一個窄的帳戶查詢工具,並證明身分、租戶、參數驗證、執行與稽核都由應用程式負責。實作 · 120 分鐘
  4. 03脈絡、記憶與狀態:中斷後如何接著做拆開模型當下的工作中脈絡、正式可信的工作狀態與選擇性保留的記憶,再測暫停、恢復、到期時間、刪除與污染。實作 · 125 分鐘
  5. 04RAG 與知識檢索:先確認找得到正確資料建立雙租戶檢索測試資料,在排序前套 access 控制,比較檢索版本,引註與答案說明文字分開評分。實作 · 150 分鐘
  6. 05MCP 與外部系統:工具互通後,權限怎麼管?用 MCP 暴露一個唯讀知識查詢,綁定已驗證身分的租戶,並測核准、伺服器失敗、惡意結果與完整移除。實作 · 140 分鐘
  7. 06Agent 迴圈與任務協調:進度、預算與停止條件實作外部狀態機,加入預算、檢查點、重複偵測、終止狀態與唯讀研究工作的轉交人工資料包。實作 · 150 分鐘
  8. 07多 Agent 協作:先確認工作能否獨立拆分把廣度優先研究版本放在單 Agent 基準版本旁邊;只有獨立工作的實測涵蓋增益值得協調成本時才保留。實作 · 165 分鐘
  9. 08人工審查:把核准內容保存下來,再恢復工作規則檢查放在外部操作邊界,保存待審資料包;授權審查者決定後,只能恢復原本那個精確執行。實作 · 105 分鐘
  10. 09Agent 評測與可觀測性:答案對,過程也要合規把實際失敗形態做成隔離的、可重複的測試集,分別檢查最終狀態、證據、規則行為與執行執行軌跡。實作 · 120 分鐘
  11. 10上線前的安全與成本:先演練停止、撤權與復原把身分、機密、資料處理、預算、事故、回復版本與負責人做成分階段上線準備驗收門檻。實作 · 120 分鐘
  12. 11總整專案:做出每項主張都有來源的行銷研究 Agent用 Mariner Cloud 合成案例,完成來源檢索、主張核對、人工審查與重複評測,交付能重跑的行銷研究系統。專案 · 5 到 8 小時

動手完成的專案

用成果證明你真的能把系統運作起來。

專案 P1

有型別的 agent 邊界

先把嚴格輸出契約、唯讀工具、正式可信的狀態與測試資料執行器接好,再加入自治迴圈。

產出: 一個 TypeScript 套件,包含 schema、模擬轉接層、工具授權、狀態測試資料、測試與簡短架構決策紀錄。

專案 P2

可營運的研究 agent

把檢索、MCP、有上限的任務協調、人工核准、評測與正式環境控制套用到總整專案資料集。

產出: 可供預備環境檢查的參考實作、證據台帳、審查資料包、評測報告、成本試算、操作手冊與 go/no-go 紀錄。

實作準備進正式環境時

帶著實作證據來,不用從空白摘要開始。

有效的實作審查,起點應該是任務測試資料、權限地圖、執行軌跡、評測報告、失敗案例與成本上限。Tenten 可以根據這些資料檢查整合與營運缺口,不必把課程裡已經證明過的決策全部重開。