什麼是 AI 中的理性代理?
理性代理是一種 AI 代理,會根據當下條件選擇最有可能達成目標的行動。它會運用觀察結果、知識、限制條件與表現指標來評估可用的行動。對於以 LLM 為基礎的代理而言,理性的行動可能是呼叫工具、蒐集更多證據、修改輸出、請求人工核准,或停止任務。理性並不保證完美的結果,而是指在當下所擁有的資訊與資源下,做出最有理有據的選擇。
AI 中的理性代理方法是什麼意思?
理性代理方法將 AI 視為任務環境中的行動者。它會接收感知資訊並維持相關狀態,考量可行的行動,然後選擇對其指標貢獻預期最高的那一個。對於 LLM 代理而言,這可能是工具呼叫、證據請求、核准節點、修改,或有意識的停止。
這與僅憑流暢對話來判斷智慧不同。狹義的規則在有限任務範圍內也可能是理性的,而流暢的推理仍可能優化了錯誤的目標。理性需要有明確的指標,以及可觀察的決策過程。
理性代理的 PEAS 框架
PEAS 定義了理性代理做決策時所處的任務環境。這幾個字母分別代表 Performance measure(績效指標)、Environment(環境)、Actuators(致動器)與 Sensors(感測器)。績效指標說明什麼樣的結果算是成功;環境則界定代理必須在其中運作的條件;致動器定義代理可採取的行動,感測器則決定代理能觀察到什麼。這些要素共同提供判斷代理是否為其目標選擇了最理性行動所需的資訊。
| PEAS 元素 | 設計問題 | AI 研究代理範例 |
|---|---|---|
| 性能指標 | 哪些結果算是成功? | 來源品質與任務覆蓋率;所需格式下的事實準確性 |
| 環境 | 代理在哪裡運作? | 使用者簡述與網路來源;上傳的檔案加上工具輸出 |
| 致動器 | 代理如何影響環境? | 網路搜尋與檔案讀取;報告草擬加上澄清或升級處理 |
| 感測器 | 代理能感知哪些資訊? | 使用者指示與檢索到的頁面;檔案內容加上工具回應 |
PEAS 也能釐清權限範圍。一個研究代理或許可以讀取上傳的文件,卻沒有權限發布其報告。它可能能夠草擬結論,但仍需獲得核准才能分享出去。這些限制會改變哪些行動是可行的。
理性代理如何運作?
現代以 LLM 為基礎的理性代理迴圈,將模型推理與工具、狀態、驗證機制及人為控制連結在一起。模型可以提出行動方案,但整個系統才會決定該行動是否可行且恰當。
感知: 接收指示、檔案、檢索到的頁面,或工具回應。
表徵: 依據目前證據與相關歷史更新任務狀態,並記錄尚未解決的需求。
產生: 找出獲允許且有用的行動。要求澄清也可以是一種行動。
預測: 評估每個選項可能對品質、風險、成本及剩餘工作量的影響。
選擇: 在套用限制條件後,選出預期表現最好的可行行動。
執行: 執行工具呼叫或與使用者溝通,並記錄是否成功。
檢視: 將結果視為新的感知輸入。可以選擇繼續、要求更多證據、請求核准、修正、上報,或停止。
編碼代理的運作方式展示了這個決策迴圈在實務中如何運作。它先透過讀取失敗的測試與相關程式碼來感知任務,接著表徵可能的問題,並比較可行的行動,例如檢查另一個檔案或進行有針對性的修改。在選定並執行某個行動後,代理會透過執行相關測試來檢視結果。只有在其他行動仍具備足夠預期價值時,迴圈才會繼續進行。當修正通過所需檢查、進一步調查不太可能改善結果,或下一步行動需要人為核准時,就應該停止。
什麼決定了代理是否具有理性?
理性取決於決策情境,而非最終回應是否精緻。可從以下幾個因素來評估:
績效指標: 應能反映真實任務,同時保留不可妥協的限制條件。
感知序列: 代理應運用相關歷史資訊,而非僅憑單一模糊的片段判斷。
先備知識: 知識應符合該領域,且對任務而言足夠即時。
可用行動: 工具集必須能支撐工作所需,同時權限也應限制不安全的操作。
不確定性: 證據薄弱時,應觸發安全的備援方案、要求澄清或上報。
資源: 時間與運算預算應與任務的風險及複雜度相匹配。
停止條件: 成功標準、失敗上限或核准界線,應能終止執行。
這些因素決定了在特定情境下哪個行動才是理性的。當獲核准的知識庫提供了足夠證據時,客服代理可以回答常規的政策問題。但如果帳戶爭議涉及缺失記錄,或超出代理的授權範圍,上報就成為理性的選擇。因此,最佳行動會隨可用資訊與代理獲允許的範圍而改變。
AI 中理性代理的類型
AI 系統常見的代理架構有五種:簡單反射式、基於模型的反射式、目標導向式、效用導向式,以及學習型代理。每種架構都提供了不同的方式,從可用資訊中選擇行動。這些分類並非互斥,也並未涵蓋所有情況。現代以 LLM 為基礎的代理,通常會在同一個工作流程中結合其中多種架構。
| 常見架構 | 決策依據 | 適用情境 | 主要限制 |
|---|---|---|---|
| 簡單反射式 | 當前輸入加上一條規則 | 任務範圍狹窄時 | 忽略隱藏狀態 |
| 基於模型的反射式 | 輸入加上內部狀態 | 歷史會影響選擇時 | 狀態可能變得過時 |
| 基於目標 | 朝目標邁進的程度 | 代理必須進行規劃時 | 目標可能無法對權衡取捨排出優先順序 |
| 基於效用 | 結果的預期價值 | 價值或風險有所差異時 | 評分標準難以設計 |
| 學習型 | 經驗會更新行為 | 條件會改變 | 不良回饋會導致偏移 |
簡單反射式代理
一個範圍狹窄的客服路由代理,可能會將含有已核准帳單關鍵字的訊息轉送至帳單佇列。當標籤明確、風險又低時,這樣的做法可以是理性的。但當意義取決於歷史脈絡時,它就會出現困難。
基於模型的反射式代理
基於模型的客服代理會維持會話狀態,能記住已完成的身分驗證,避免重複執行已失敗的步驟。當最新訊息缺乏上下文時,狀態資訊很有幫助,不過過時的狀態也可能誤導代理。
目標導向式代理
目標導向的研究代理會將報告需求拆解成幾個問題,檢視資料來源,再修訂缺漏的段落。目標指引著它的工具呼叫,但「完成報告」本身並未定義何謂足夠的證據,也未說明速度與資料深度孰輕孰重。
效用導向式代理
旅遊或採購代理會比較成本與風險各不相同的選項,可能優先考量政策合規性而非時程配合度,並在超出限額時要求核准。挑戰在於如何指定經得起檢驗的權重。
學習型代理
客服助理可以學習審核者接受哪些提議的回覆。推薦代理可以採用明確的回饋,而非把每次點擊都當作成功。只有當回饋確實反映真正目標,且有防範機制避免走偏時,學習才能保持理性。
現代 LLM 代理可能會混合運用上述所有要素。「以 LLM 為基礎」這個標籤本身並不能證明其具有理性;指標與控制機制仍需要經過刻意的設計。
理性代理與智慧代理
「智慧代理」是一個廣泛的類別,泛指具有一定自主性並能採取行動的系統。「理性代理」則聚焦於相對於績效指標的行動選擇。
| 維度 | 理性代理 | 智慧代理 |
|---|---|---|
| 主要重點 | 預期表現 | 自主能力 |
| 複雜度 | 可能採用簡單規則 | 涵蓋範圍從自動化到先進 AI |
| 關鍵測試 | 該行動是否合理? | 它能否完成任務? |
| 關係 | 決策框架 | 系統類別 |
智慧並不保證目標合理或行動安全。編碼代理可能產生有效的程式碼,卻在範圍之外進行修改。研究代理可能根據薄弱的資料來源,寫出流暢的文字。理性所要問的是,在既定限制條件下,每個選擇是否確實服務於既定任務。
理性代理的真實案例
每個範例都會對應其環境、觀察結果、行動以及績效指標,但不預設其具有理性。
AI 研究型 Agent
它的環境包括使用者需求說明、網頁內容和提供的檔案。指示與檢索到的證據都是觀察結果。該 Agent 可以精煉查詢、檢視來源、要求澄清或起草內容。表現取決於來源品質和任務覆蓋範圍;所需格式下的事實準確性決定了驗收門檻。證據相互矛盾時,可能需要再次搜尋。
程式碼開發 Agent
程式碼開發 Agent 在專案指示和工具權限下於程式碼庫中工作。它觀察原始檔案及測試輸出。它可以搜尋程式碼、進行編輯、執行特定測試,或針對風險較高的工作要求核准。變更應解決所述問題,且不應改動無關的行為。相關驗證必須通過後才能停止。
客服 Agent
客服 Agent 在對話、經核准的知識以及帳戶存取權限的範圍內運作。它觀察訊息與工作階段狀態。它可以檢索政策、起草回覆、要求提供更多細節,或升級處理。表現由解決品質與政策合規性共同決定。當缺乏明確記錄時,升級處理可能是合理的做法。
資料分析 Agent
資料分析 Agent 接收業務問題與資料集。它觀察結構定義(schema)與工具輸出。它可以檢查缺失值、執行查詢、建立圖表,或否決缺乏支持的結論。表現由分析正確性與可重現性共同決定。在解讀趨勢之前,應先檢查單位與篩選條件。
工作流程 Agent
工作流程 Agent 負責協調跨軟體工具的流程。它觀察接收的記錄與狀態更新。它可以擷取欄位、準備草稿、將項目轉送,或暫停以等待核准。正確的狀態轉換與可追溯性決定了成功與否。單憑有可用的 API 呼叫,並不足以作為推進任務的理由。
多 Agent 研究系統
工作 Agent 各自接收獨立的研究問題;協調者則接收它們提供的證據。工作 Agent 在各自範圍內進行搜尋或分析。協調者可以要求重新執行、解決衝突、進行綜合整理,或終止表現不佳的分支。最終的準確性與覆蓋範圍固然重要,但重複的工作會降低整體效益。只有當任務分解能提升預期表現時,增加更多 Agent 才有幫助。
在這些案例中,理性體現在工具選擇、證據要求、核准檢查、修訂與停止等各個環節。每個行動都應足以提升預期任務表現,以証明其成本是值得的。
理性 Agent 設計的優點與局限
這套框架將模糊的自主性轉化為明確的決策模型,並讓工作流程的局限變得可見。
優點
評估明確: 有了效能指標,成功便可被檢驗。
決策可追溯: 記錄下來的證據與工具呼叫有助於後續調查。
自主性可控: 限制條件與核准節點能約束行動。
能處理取捨: 效用可用於比較不同的結果。
停止機制有效: 門檻能減少過早給出答案或陷入無限迴圈的情況。
局限
目標設定不當: 代理指標可能未能反映使用者真正的目標。
資訊不完整: 缺乏證據會妨礙做出合理的決策。
模型出錯: LLM 可能誤判狀態或選錯工具。
運算資源有限: 近似運算可能會忽略更好的選項。
問責存在缺口: 高影響力的行動仍需要有負責人與人工審核。
認識 Kimi Agent:將知識轉化為成果
Kimi Agent 展示了以 LLM 為基礎的理性 Agent 如何處理知識密集型工作。只要給定一個目標,它就能先規劃任務,再利用內建工具完成所需的各個步驟。你可以用它來研究主題、處理來源材料,或建立可編輯的成果,而不必另外建置一套協調層。
將來源知識帶入任務
Kimi 最多支援上傳 50 個檔案,單個檔案上限為 100 MB。它可以處理 PDF 以及常見的辦公文件格式。圖片、TXT 檔案和影片可以提供額外的內容脈絡。
這些材料會成為該 Agent 任務環境的一部分。你的提示詞定義了預期的成果,而上傳的檔案則提供完成任務所需的知識。
將研究成果轉化為可編輯的成品
Kimi Agent 能夠從蒐集資訊一路走到產出可用的成果:
深度研究: 建立一份有來源支持的結構化報告。
網站: 根據需求說明建立一個可運作的多頁面網站。
簡報: 根據來源材料生成可編輯的 PPT。
文件與試算表: 將資訊整理成實用的工作成果。
任務不必以聊天回覆作為結尾。Kimi Agent 可以在同一個工作流程中,將它蒐集到的資訊轉化為可編輯的成品。
透過 Kimi Agent Swarm 擴展更大型的任務
Kimi Agent Swarm 可以將一個大目標拆分成多條獨立的工作流程。子代理各自處理不同的研究問題或批次任務項目,最後再將結果整合。
這種方式適用於大規模搜尋、長篇寫作以及批次作業。當各分支可以獨立進行時,並行執行最為有效;而當每一步都依賴前一步經驗證的結果時,循序執行仍更為適合。
如何評估一個理性代理
在設計與測試階段使用此檢查清單,同時檢視決策過程與最終產出。
績效指標: 是否能反映成功結果並維持限制條件?
可觀察性: 代理能感知哪些條件?
知識: 先前知識是否適用且足夠新?
行動: 所需工作是否能在權限範圍內完成?
不確定性: 薄弱的證據是否會觸發檢查或上報?
資源: 預算是否與任務風險相符?
人工審核: 誰來核准不可逆的行動?
日誌記錄: 審核人員能否還原決策與結果?
停止條件: 執行是否在成功、可控失敗或上報後停止?
給研究型代理提供互相矛盾的資料來源,觀察它是否會尋找更可靠的證據。給編碼代理一個失敗的指令,看它是否會先診斷問題,而不是直接再次修改。缺乏上下文資訊的客服代理,應該主動要求補充資訊,而不是自行編造內容。
評估重複搜尋、忽視錯誤、無依據主張、違反核准規定,或過早停止等情況。若代理能察覺工具呼叫失敗並妥善應對,這並不代表其不具理性。同時測試停止門檻是否能在品質與資源使用之間取得平衡。
結論
理性代理是一種在真實限制下,依據可得證據選擇行動的決策框架。對於現今以 LLM 為基礎的代理而言,行動可能包括工具呼叫、證據請求、核准檢查、修改,或有意識地停止。無論是研究型、編碼型代理,還是客服流程、多代理系統,都可以套用這一框架。任何代理都不會天生具備理性,理性與否取決於目標、觀察條件、權限、評估方式,以及合適的停止策略。