跳至主要內容

production AI agent security cost checklist

實作

上線前的安全與成本:先演練停止、撤權與復原

把身分、機密、資料處理、預算、事故、回復版本與負責人做成分階段上線準備驗收門檻。

難度
進階
預估時間
120 分鐘
更新日期
2026-10-02
文案複核
speak-human-tw
兩輪
本課內容
  1. 01先把定義說清楚
  2. 02現場情境
  3. 03實作範例
  4. 04照著做,每一步都有檢查點
  5. 05實務脈絡
  6. 06動手實作
  7. 07故障診間
  8. 08正式上線前的邊界
  9. 09資料來源與主張限制

這一課會完成什麼

  • 畫出身分、資料分類、信任邊界、權限與外部操作
  • 用已量測的測試資料用量與情境數量估單次執行成本
  • 演練撤權、服務中斷、提示注入、重複操作效果與人工備援流程
  • 產出有負責人、驗收門檻、回復版本與緊急停止權責的分階段 go/no-go 紀錄

開始前先準備

  • • 具備已保存的狀態、核准與操作效果紀錄的有上限的 agent
  • • 模組 9 的通過的評測基準版本與具代表性的執行軌跡
  • • 有模擬或安全限定範圍的串接的非正式環境

先把定義說清楚

上線前的營運檢查

上線準備要提出證據,說明這項服務能在指定的可靠性、安全、隱私、成本與支援範圍內運作。除了程式控制,還要有受限身分、機密隔離、資料保存規則、預算、警示、操作手冊、回復版本與變更審查。團隊也要指定有權停止系統的人,並實際演練事故處理。一次展示成功只提供部分證據;合成資料上的費用估算與測試結果,不能直接當成正式環境的上線依據。

Agent 把非確定性的決策接到資料/工具。模型可提出操作;身分驗證、授權、驗證、交易、稽核與復原還是應用程式責任。

平均 token 成本看不到失控迴圈、檢索分支擴散、失敗的重試、多 Agent 放大效應、審查者時間或工具費用。成本控制必須和品質/延遲一起進執行預算與發布驗收。

沒演練過的控制只是推測。事故演練會暴露缺漏權限、過期聯絡人清單、緊急停止開關歧義、恢復路徑未測,以及回答不了『發生什麼』的儀表板。

現場情境

Helix internal pilot readiness review

具名合成情境。Helix Labs、數量、成本、事故、服務水準與演練結果都是測試資料,沒有正式環境部署或客戶結果主張。

負責人
你是技術負責人,要向安全、財務、行銷操作與支援提內部試行決策。
要做的決策
看完控制證據、單次執行的完整成本、演練與殘餘風險後,決定 20 位使用者的唯讀試行是核准、附條件地核准或拒絕。
目前狀態
唯讀 Helix 研究 Agent 已通過固定評測集,也能暫停等待核准。團隊提議讓 20 位具名使用者試行,假設每月執行 300 次。模擬供應商在軌跡中回報輸入與輸出用量;示例單價存於有版本的費率表,可替換而不必改程式。
預期成果
關鍵控制/演練全過才允許分階段唯讀試行;撤權 fail、操作結果未知、無人負責的警示、關鍵評測回歸測試或缺漏回復版本都是 no-go。

限制條件

  • • 試行保持唯讀,不能發布、send 訊息、變更支出或修改來源系統。
  • • 預備環境索引只能放合成與另行已核准的內部文件。
  • • 每個串接使用服務身分,範圍、負責人、輪替路徑與撤權測試都要有紀錄。
  • • 執行開始前就限制回合、工具呼叫、總經過時間、已檢索的位元組與計算後支出。
  • • 價格、配額、保存期限與 API 行為是設定輸入;真正上線前要按目前供應商條款重查。

實作範例

憑證演練失敗,Helix 先停試行

證據類型: 具名模擬情境

測試資料上線準備報告顯示品質驗收門檻通過,估算的中位數執行成本也在示例預算。憑證遭竊或外洩演練中,操作人員撤銷連接器機密;新的請求 fail,某個已啟動工作單元卻繼續用已快取的 token 9 分鐘。儀表板只顯示通用工具錯誤,看不出使用哪個身分。

審查小組即使品質/估算的支出可接受,仍記 no-go。負責人移除長效工作單元快取,在已遮蔽敏感資訊的工具事件加身分 ID/憑證版本,並跨所有工作單元執行池測撤權傳播。關鍵演練集合與固定評測集必須完整重跑,修復期間不調門檻。

第 2 次合成演練確認,撤權後的新呼叫與已啟動工作單元都被拒絕,紀錄也沒有機密。小組只附條件核准 5 位使用者的唯讀試行,2 週後重審。決策列出值班負責人、每次執行與每日斷路器、回復指令,以及禁止寫入的規則。

主張限制

演練事件、時間差、成本與核准全為虛構,不建立其他系統適用的撤權目標或預算。供應商安全指引只能降低常見風險,不能證明安全;費率表也會變。部署前須用 verified 契約、架構與已量測的值取代示例。

做法

照著做,每一步都有檢查點

Helix 信任邊界地圖,連接使用者、agent 服務、模型 API、唯讀工具、資料集、狀態、核准與遙測,標示身分、資料分類、預算與緊急停止控制。

現場情境

看完控制證據、單次執行的完整成本、演練與殘餘風險後,決定 20 位使用者的唯讀試行是核准、附條件地核准或拒絕。

  1. 01畫服務與信任資產清單
  2. 02執行預算與權限
  3. 03從執行軌跡建單次執行的完整成本

驗收條件

證據包支援 5 位使用者的唯讀 canary,或清楚 no-go。成本可由已量測的測試資料/可替換的費率表重算;5 個演練都有偵測/復原紀錄;不經模型決策就能用 1 個指令或設定旗標停新的執行。

這張圖要幫你看懂什麼從服務資產清單畫確定性的信任邊界圖解,旁邊放上線準備矩陣;身分、方向、範圍、資料分類與負責人都要精確。
  1. 01

    畫服務與信任資產清單

    列使用者、應用程式、模型供應商、MCP/工具伺服器、資料集、狀態儲存區、核准服務與遙測路徑。每個邊界記身分、資料分類、加密責任、保存期限、區域/契約限制條件與允許操作。

    檢查點 · 每個網路呼叫/已儲存的欄位都有負責人、用途、資料分類、憑證、權限、保存期限與刪除/撤權路徑。

  2. 02

    執行預算與權限

    從發布清單載上限,服務身分只給讀取範圍;工具、類型或預算缺少就拒絕執行。加每次執行、每位使用者、每日斷路器與獨立全域停用旗標。

    檢查點 · 超出回合上限、超出呼叫上限、超時、超出位元組上限、超支與禁止工具共 6 個測試資料都在不允許的操作效果前停止,原因碼各自不同。

  3. 03

    從執行軌跡建單次執行的完整成本

    取評測集的已量測的輸入、輸出、工具、重試與審查者數量,套附日期的示例費率表,算中位數/p95 執行成本,模擬每月數量/失敗尖峰,列出 unknown。品質/審查負擔放在成本旁。

    檢查點 · 另一位審查者能從執行軌跡匯出重算每個公式,換費率表不需改應用程式邏輯。

  4. 04

    跑 5 個受控事故

    演練撤銷憑證、供應商中斷、惡意檢索內容、操作生效後逾時,以及人工唯讀備援。每次記下偵測方式、影響控制、通訊、復原、證據和負責人,再核對是否留下未處理的操作。

    檢查點 · 演練資料包證明拒絕執行、0 個 completed 禁止操作效果、決策有負責人,每個嘗試的執行都有已知最終狀態。

  5. 05

    召開上線準備審查

    呈現評測門檻、演練、資料資產清單、權限測試、成本分布、殘餘風險、值班人員、canary 範圍、回復版本與審查日期。不能為了讓候選版本過而現場改驗收門檻。

    檢查點 · 已簽核決策包含發布/hold/回復版本、精確範圍、證據連結、負責人、到期時間、停止權責與擴大範圍條件。

實務脈絡

展示版之後

G1

實作拆解

沿真實資料流列服務資產:請求入口、Agent 服務、模型 API、工具與 MCP 伺服器、資料集、狀態及核准儲存區、遙測。每段記下身分、憑證、網路目的地、資料分類、加密、保存期限、區域、負責人及允許操作。衍生快取、備份、軌跡匯出與審查截圖也納入,刪除請求才能涵蓋全部儲存位置。

執行開始與每次派送前,檢查回合、工具呼叫、總經過時間、檢索位元組與計算後 USD,另設每位使用者、每日及全域斷路器。成本試算表從軌跡匯出輸入輸出計價單位、工具費用、重試、檢索、工作單元與審查分鐘,報中位數、p95 和失敗尖峰。費率表附日期且可替換;供應商單價、配額或保存條件改變,就重審設定與上線決策。

5 個演練先定預期偵測、控制影響範圍、安全狀態與停止權責,再實際測試。撤權涵蓋已啟動工作單元與連線池;服務中斷測有限重試及人工備援;提示注入測權限與對外連線仍受限制;操作後逾時先核對結果;緊急停止同時停需求接收、佇列消費、恢復與工具權限。保存時間紀錄、軌跡、缺口、負責人和到期日。

審查小組先看關鍵證據。禁止操作、最終結果未知、撤權失敗、缺回復方式、警示無人負責或關鍵回歸失敗,任一項都判 no-go。通過也只核准明列範圍,例如 5 位使用者的唯讀試行、2 週審查,不能直接開放 20 人提案。簽核紀錄包含發布版本、證據連結、殘餘風險、值班、回復指令、停止負責人和擴大範圍門檻;到期未重審就縮回權限。

G2

營運檢查

安全審查要驗證最小權限,而非只看設定截圖。使用測試身分逐一嘗試允許的讀取、禁止的寫入、錯誤租戶、過期憑證、未核准目的地與秘密存取;同時確認資料來源、工具伺服器與網路層都會擋。接著撤銷憑證,涵蓋冷啟動、溫工作程序、連線池與背景佇列,量測最後一次成功與第一個失敗事件。日誌只留身分識別碼與版本,不留秘密值。若撤銷後仍有任何路徑成功,候選版本維持不通過。

成本決策要和服務範圍一起看。用固定工作量建立正常、長尾與故障三種情境,計入模型輸入輸出、檢索、工具費、重試、多工作者與人工審查。再套每次執行、每日與全域斷路器,模擬費率變更和請求暴增。報表明確標示哪些是量測、哪些是假設、哪些仍未知;不要把供應商當下價格寫成課程常數。若昂貴路徑只對少數模糊任務有用,路由器應先把規律任務送回較簡單流程,成本改善不能靠降低證據或安全門檻換取。

營運交接至少需要值班聯絡、儀表板、警示條件、事件分級、停止方式、恢復條件與變更流程。全域停止不只關閉入口,也要停止佇列消費、禁止舊工作恢復、撤銷工具權限並對帳執行中的效果。恢復前重跑關鍵評測與權限測試,確認造成事件的設定已修。每次演練由觀察者記下實際步驟與耗時,更新操作手冊;若只有系統作者知道怎麼停,這套控制還沒有成為團隊能力。

G3

驗證與上線

資料治理檢查從一筆請求走到底:原始文字進哪個模型、檢索段落從哪裡來、狀態與核准存多久、追蹤與備份誰能看、使用者要求刪除時哪些副本會同步。每個欄位只保存完成目的所需時間;偵錯需要更長保留時另做授權。第三方服務的區域、保留、訓練使用與刪除能力按目前合約確認,不能用一般文件替代自己的設定與責任。

秘密管理要避免三種捷徑:把金鑰放在提示或工具參數、讓背景工作繼承開發者環境、將完整標頭寫入追蹤。工作負載使用短效身分與限定受眾,啟動時拒絕過寬範圍;輪替與撤銷由自動化流程執行。錯誤日誌只記身分版本與失敗原因。安全人員應能在不請模型合作的情況下立即撤銷工具權限並停止新工作。

供應商故障演練要涵蓋慢回應、限制流量、部分區域不可用與回應格式改變。控制器限制重試,保留請求識別碼與最後安全狀態;若研究結果可以延後,就進待辦,不切到未經評測的模型。人工備援只能使用已核准資料與讀取流程,產出同樣證據欄位。恢復服務後先跑健康檢查與關鍵案例,再逐步開放,不把累積佇列一次灌回去造成第二波故障。

成本警示要和價值單位對齊。除了每日總額,也監控每個完成研究、每個證據充足簡報、每次人工審查與每類終止原因的成本。若費用上升來自更多成功的高價值任務,處理方式不同於無進展或重試造成的浪費。所有節流策略先跑品質與安全回歸;不能為了壓成本移除引用驗證、縮短必要檢索或放寬人工審查。

G4

補強練習

警示要直接連到操作手冊與停止權。費用、權限拒絕、未終止工作、憑證版本過期或未知效果超過門檻時,值班人員能從事件頁看到影響範圍、查詢步驟與可執行指令。沒有處理者的警示在審查中視同控制缺失。

回滾不只部署舊程式,也要處理提示、工具清單、政策、索引與狀態格式。版本清單標出可獨立回復項目與相依性,演練從候選退回上一個通過版本,確認等待工作、核准與效果帳本仍能解讀,不產生第二次執行。

試行期間每天檢查使用者、任務類別、成功與終止分布、證據錯誤、延遲、費用、人工等待與安全事件。達到任何停止條件就縮小或關閉,不等兩週檢討日。擴到二十位使用者前,先證明五人金絲雀的負載與支援流程成立。

G5

交付前最後檢查

供應商條款、模型識別碼、費率卡或資料保留設定改變時,自動建立重新審查待辦。負責人確認成本試算、隱私邊界與關鍵案例後才更新核准版本;外部變更不能在沒有紀錄的情況下默默進入試行服務。

試行結束後撤銷所有臨時身分與存取,保留必要稽核,其餘資料依期限清除。

清除完成後由資料擁有者抽查,結果附在試行結案紀錄。

G6

延伸實作

試行審查要指定擴張時不可改變的界線:保持只讀、資料類別不增加、工具目的地不增加、每次執行與每日上限維持、重大失敗仍為零。若業務要求新增寫入、外部聯絡或更敏感資料,另開威脅模型、人工核准、效果對帳與事故演練,不能把它當成原試行自然延伸。這份變更分類讓團隊分得出一般容量調整與實質風險擴張,後者需要新的簽核與回滾證據。

動手實作

以 5 個事故演練完成上線審查

整理 Helix 服務資產清單/成本模型,在預備環境跑 5 個受控事故,再以證據決定唯讀 canary。

準備項目

  • • 只用模擬連接器或沒有正式環境寫入權限的專用預備環境租戶。
  • • 每個演練指定演練主持人、操作人員、觀察者、決策負責人與安全停止。
  • • 記錄評測報告、權限規則、費率表與操作手冊的版本。

本課產出

有版本紀錄的服務/資料流資產清單、權限矩陣、已量測的成本試算表、5 份演練報告、監測地圖、操作手冊、風險登錄表與已簽核的 canary 決策。

起始模板: 上線準備清單與成本公式

YAML
service: helix-research-agent
release: 0.9.0-rc1
scope: internal-read-only-canary
users: 5
prohibited_effects: [publish, send_message, change_budget, write_source_record]
budgets:
  max_turns_per_run: 8
  max_tool_calls_per_run: 12
  max_wall_seconds: 90
  max_retrieved_bytes: 250000
  max_calculated_usd_per_run: 1.00
identity:
  service_principal: helix-research-staging
  scopes: [corpus.read, crm_fixture.read]
  owner: platform-oncall
data:
  allowed_classes: [synthetic, approved-internal]
  retention_days: 30
critical_gates:
  prohibited_effect_count: 0
  critical_eval_failures: 0
  unresolved_unknown_effects: 0
  revocation_drill: pass
  rollback_drill: pass
drills:
  - credential_revocation
  - provider_outage
  - retrieved_prompt_injection
  - timeout_after_fake_effect
  - manual_read_only_fallback

# Use a dated, reviewed rate card. Do not paste current vendor prices into code.
# modeled_run_usd = input_units * input_rate + output_units * output_rate
#                 + tool_fees + retry_allowance + allocated_review_cost

預期結果

證據包支援 5 位使用者的唯讀 canary,或清楚 no-go。成本可由已量測的測試資料/可替換的費率表重算;5 個演練都有偵測/復原紀錄;不經模型決策就能用 1 個指令或設定旗標停新的執行。

留給下一課

上線準備清單、成本試算表、事故案例、操作手冊與 canary 條件都是總整專案必備輸入;測試資料假設未被替換並在目標環境重跑前,不得宣稱可正式上線。

驗收條件

  1. 01清單涵蓋身分、串接、資料分類、存放區域、權限、負責人、保存規則與撤權方式。
  2. 026 個預算超限案例和禁止操作都在執行前被拒,停止原因可追溯。
  3. 03中位數、p95、每月、重試、工具與人工審查成本可重算,且標成以測試資料為基礎的估算。
  4. 045 個演練與已簽核決策證明偵測、控制影響範圍、復原、回復版本、停止權責、殘餘風險與下一個審查日期。

常見故障

故障診間

F1憑證撤銷後,部分工作單元仍能使用。
先檢查
對照身分 ID、憑證版本、工作單元執行池、快取存續時間與撤權時間戳記。
可能原因
長效 token 或連線池活得比假設的撤權邊界久。
修復方式
Invalidate 快取、縮短憑證存續時間、recycle 受影響的工作單元,確認傳播後再恢復。
下次怎麼避免
每個執行執行池自動跑撤權演練;obsolete 憑證版本觸發警示。
F2逾時後,團隊不知道外部寫入是否完成。
先檢查
查本機操作台帳、供應商冪等鍵、轉接層驗收憑證與結果核對端點。
可能原因
客戶端沒預留/核對實際結果操作效果就重試不確定結果。
修復方式
Quarantine 執行,向正式可信的狀態核對實際結果,之後只從已記錄的結果恢復。
下次怎麼避免
授予寫入權限前先設計冪等性與結果未知復原。
F3請求次數沒變,每月支出卻超出模型。
先檢查
按任務類型拆回合、token、工具費用、重試、檢索位元組、工作單元次數與審查者分鐘。
可能原因
模型只算平均呼叫,漏了尾端表現行為或重試放大效應。
修復方式
依執行軌跡重算,限制昂貴的分支,predictable 任務路由到更簡單的路徑。
下次怎麼避免
一起監測單次執行成本分布、預估執行量、品質與人工審查工時。
F4緊急停止開關關掉 UI,背景執行還在。
先檢查
檢查排程器、佇列消費端、恢復、工作單元租約與停用後工具伺服器授權。
可能原因
停止控制只在請求需求接收,沒有進每個執行邊界。
修復方式
拒新的工作、cancel 租約、禁止恢復、撤銷工具 access,再核對實際結果尚在執行的操作效果。
下次怎麼避免
Scheduled 演練驗全域停止/恢復,同時斷言佇列與工作單元。

展示版之後

正式上線前的邊界

  1. 01列出所有服務、信任邊界、資料分類、身分、憑證與允許操作。
  2. 02最小權限服務身分的輪替/撤權路徑都測過。
  3. 03機密不得出現在提示詞、工具輸出、執行軌跡、截圖或待審資料包。
  4. 04每次執行、每位使用者、每日與全域斷路器在模型外執行。
  5. 05按任務類型量單次執行成本、品質、延遲、重試、工具費用與審查負擔。
  6. 06定義保存期限、刪除、access 審查、事故通知與供應商變更審查。
  7. 07操作手冊涵蓋服務中斷、提示注入、憑證遭竊或外洩、操作結果未知、回復版本與人工備援流程。
  8. 08具名負責人有權停止執行;擴大範圍必須重新提出證據。

證據類型

資料來源與主張限制

資料來源只支撐本課標示的主張,不代表換一個系統也會得到相同結果。

  1. [1]
    建置 agent 的安全指引

    OpenAI · 官方文件 · 2026-08-20

    prompt injection · 結構化資料邊界 · MCP 核准
  2. [2]
    Guardrails 與人工審查

    OpenAI · 官方文件 · 2026-08-20

    審核中斷 · 可恢復狀態 · 工具層 guardrail
  3. [3]
    AI agent 的有效 context engineering

    Anthropic · 官方文件 · 2026-08-20

    context 預算 · 壓縮 · 結構化筆記
  4. [4]
    AI Risk Management Framework

    NIST · 官方文件 · 2026-08-20

    風險治理 · 衡量方式 · 營運責任

延伸的 Tenten 資源

實作準備進正式環境時

帶著實作證據來,不用從空白摘要開始。

有效的實作審查,起點應該是任務測試資料、權限地圖、執行軌跡、評測報告、失敗案例與成本上限。Tenten 可以根據這些資料檢查整合與營運缺口,不必把課程裡已經證明過的決策全部重開。