把「做得好」寫成可以核對的結果
先寫驗收條件,才有方法比較 AI 版本。Anthropic 在 2026 年 1 月的 Agent 評估文章,區分一次測試、重複嘗試、執行記錄與環境中的最終結果。[1] 對企業試點,這帶來一個實用提醒:除了看回答文字,也要核對事情是否真的完成。例如系統聲稱已建立工單,應檢查實際工單、欄位和權限,而不只檢查句子是否流暢。
建立一小套有代表性的測試題
可先從同事實際遇到的問題整理幾十個經批准、適當去識別化的樣本;這是起步建議,並非固定的充分樣本數。每題記下資料來源、可接受答案、禁止透露的內容與需要轉交人的條件。保留一部分樣本不用來調整提示或設定,待驗收時再測試;否則容易只把系統調整到擅長那幾道示範題。
加入找不到答案、資料衝突和權限不同的情況
知識助手的測試應包括:正式文件沒有答案、舊版與新版矛盾,以及同一問題由不同角色提出。預期結果可以是指出限制、引用適當來源或轉交負責人,不必每題都生成完整答案。資料有矛盾時,能清楚停止比自行拼出一個看似合理的政策更適合作為工作工具。
同時看品質、時間與每宗完成成本
把來源是否正確、必要內容是否完整、是否越權及是否作出未授權動作分開量度。再記錄回應時間、人工覆核及重做時間,連同模型、搜尋與工具成本一起看。一般題目的高分不能抵銷一次敏感資料洩露。對關鍵失敗類型應設定明確的上線阻擋條件,而不是把所有分數混成一個平均值。
更新之後,用同一套題目重新檢查
模型、提示、知識文件、索引及外部工具改變,都可能影響原本已通過的工作。為發布版本保存測試結果,並挑選關鍵題目重複執行,觀察輸出是否不穩定。試用期間收到的新問題可加入測試庫,但應避免把未處理的個人資料直接複製進去。安排清楚的問題負責人與回復上一版本方法,才有條件持續改善。
iGears 的試行與長期支援連接點
可透過 iGears 的 30 日 AI MVP 服務討論一個有明確驗收範圍的試點;知識問答場景可配合 AI 知識助手,成本評估則可使用 AI 及雲端成本優化服務。正式交接時,測試題、資料來源、覆核責任與更新流程應成為營運文件的一部分,方便日後維護而不只留下演示畫面。
先做一個實用檢查
- AI 知識助手:按文件來源、權限與回答追溯需要討論知識問答。
- AI 及雲端成本優化:把測試品質與工作流程成本一起評估。
- 維護與營運:整理更新、文件及長期交接的責任。