劃的可解釋性與可組合技能:從黑盒到白盒的實踐路徑)
1. 從“黑盒”到“白盒”多智能體規(guī)劃為何需要可解釋技能如果你在深度強(qiáng)化學(xué)習(xí)或者多智能體系統(tǒng)領(lǐng)域摸爬滾打過一段時間大概率會對一個場景感到熟悉又頭疼你訓(xùn)練了一群智能體它們在某個復(fù)雜任務(wù)上比如《星際爭霸》的微操、《Dota 2》的團(tuán)戰(zhàn)或者一個模擬的物流倉庫協(xié)作表現(xiàn)出了驚人的協(xié)同能力勝率或效率遠(yuǎn)超預(yù)期。但當(dāng)你試圖復(fù)盤它們?yōu)楹文艽虺瞿遣ň钆浜蠒r得到的答案往往是一堆難以解讀的神經(jīng)網(wǎng)絡(luò)權(quán)重或者一串意義模糊的動作序列。你只知道“它們做到了”卻完全不知道“它們是如何思考并做到的”。這就是典型的“黑盒”困境——性能卓越但原理不明。RELIC這個工作直指的就是這個痛點(diǎn)。它的全稱是“Revealed Principles for Learning Interpretable Composable Skills in Multi-Agent Planning”翻譯過來是“用于學(xué)習(xí)可解釋、可組合技能的多智能體規(guī)劃揭示性原理”。這個名字有點(diǎn)拗口但拆解開來每一個詞都指向了當(dāng)前多智能體學(xué)習(xí)領(lǐng)域最前沿、也最實際的需求。Interpretable可解釋意味著我們不僅要結(jié)果還要理解智能體決策的內(nèi)在邏輯Composable Skills可組合技能意味著我們希望智能體能像搭積木一樣將基礎(chǔ)的、可理解的技能模塊組合起來應(yīng)對復(fù)雜任務(wù)而Multi-Agent Planning多智能體規(guī)劃則是這一切發(fā)生的舞臺一個充滿不確定性、部分可觀測性和高維交互的復(fù)雜環(huán)境。為什么這如此重要想象一下如果你將這套系統(tǒng)用于真實的自動駕駛車隊調(diào)度、工業(yè)機(jī)器人協(xié)同裝配或者電網(wǎng)協(xié)同控制。一個無法解釋的決策可能導(dǎo)致災(zāi)難性的后果并且無法追責(zé)和優(yōu)化。而可組合的技能則意味著系統(tǒng)的可維護(hù)性和可擴(kuò)展性大大增強(qiáng)——當(dāng)任務(wù)變化時你不需要重新訓(xùn)練整個系統(tǒng)或許只需要調(diào)整或新增幾個技能模塊。因此RELIC 所探討的遠(yuǎn)不止是一個學(xué)術(shù)問題它是將多智能體系統(tǒng)從實驗室“玩具”推向現(xiàn)實世界“工具”的關(guān)鍵一步。它試圖回答我們能否讓一群AI智能體不僅學(xué)會協(xié)作還能以人類可以理解的方式告訴我們它們協(xié)作的“藍(lán)圖”是什么2. RELIC的核心思想從策略中“揭示”可解釋的規(guī)劃原理要理解RELIC做了什么我們首先要拋開那些復(fù)雜的數(shù)學(xué)公式從直覺上把握它的核心思想。傳統(tǒng)的多智能體強(qiáng)化學(xué)習(xí)MARL方法無論是基于值函數(shù)如QMIX還是基于策略梯度如MAPPO其最終產(chǎn)出都是一個參數(shù)化的策略函數(shù)。這個函數(shù)接收觀測可能是全局的也可能是局部的輸出動作。這個映射關(guān)系是高度非線性的隱藏在深度神經(jīng)網(wǎng)絡(luò)的層層變換中這就是“黑盒”的根源。RELIC 采取了一種截然不同的思路。它認(rèn)為在多智能體協(xié)作任務(wù)中智能體群體表現(xiàn)出的高級別行為背后往往遵循著一些相對簡潔、可描述的“原則”或“規(guī)則”。這些原則可能是時序邏輯公式、是帶有條件的技能調(diào)用序列、或者是某種共享的協(xié)作協(xié)議。RELIC 的目標(biāo)不是直接學(xué)習(xí)一個端到端的策略而是從智能體與環(huán)境交互產(chǎn)生的軌跡數(shù)據(jù)中逆向“揭示”出這些潛在的、可解釋的規(guī)劃原理。我們可以用一個簡單的團(tuán)隊競技游戲來類比。假設(shè)我們觀察一個訓(xùn)練有素的5人籃球隊伍的比賽錄像軌跡數(shù)據(jù)。一個端到端的模型可能會學(xué)習(xí)每個球員在每一幀畫面中該如何移動、傳球或投籃但這個模型本身無法告訴我們球隊的戰(zhàn)術(shù)是什么。而RELIC試圖做的就是分析這些錄像然后告訴我們“看這支球隊在執(zhí)行一個‘擋拆Pick and Roll’戰(zhàn)術(shù)。原則是當(dāng)控球后衛(wèi)運(yùn)球至弧頂中鋒上前設(shè)立掩護(hù)原則A隨后控衛(wèi)根據(jù)防守情況選擇突破或分球原則B而其他隊員則進(jìn)行弱側(cè)拉開和隨時準(zhǔn)備接應(yīng)原則C。” 這里揭示出的“擋拆”及其子原則就是可解釋、可組合的技能。知道了這些原則我們不僅可以理解球隊為何這么打還可以將這些原則擋拆、拉開空間組合起來形成新的戰(zhàn)術(shù)。在技術(shù)實現(xiàn)上RELIC 通常會結(jié)合符號學(xué)習(xí)、程序歸納或神經(jīng)符號的方法。它可能包含以下關(guān)鍵組件軌跡采集首先通過一個基礎(chǔ)的多智能體強(qiáng)化學(xué)習(xí)算法或?qū)<已菔臼占罅砍晒Φ膮f(xié)作軌跡。技能抽象利用無監(jiān)督或弱監(jiān)督的方法從這些軌跡中自動發(fā)現(xiàn)重復(fù)出現(xiàn)的、有意義的子序列或行為模式并將其抽象為離散的“技能”或“選項”。例如在機(jī)器人足球中可能是“短傳配合”、“圍搶”、“交叉跑位”。原理歸納這是RELIC的核心。它使用一個可解釋的模型如決策樹、邏輯規(guī)則集、概率圖模型或小型神經(jīng)網(wǎng)絡(luò)來學(xué)習(xí)這些技能在何時、由誰、以何種條件被觸發(fā)和執(zhí)行。這個模型就是被“揭示”的規(guī)劃原理。它建立了從環(huán)境狀態(tài)或歷史到技能選擇的清晰映射關(guān)系。組合與驗證學(xué)習(xí)到的原理和技能被組合成一個高層級的規(guī)劃器。這個規(guī)劃器不再輸出原始的低級動作如每個關(guān)節(jié)的扭矩而是輸出技能標(biāo)識符。然后由每個技能對應(yīng)的低級控制器來執(zhí)行具體動作。最后在環(huán)境中驗證這個由可解釋原理驅(qū)動的系統(tǒng)其性能是否能夠媲美甚至超越原來的“黑盒”策略。這個過程的關(guān)鍵在于最終我們得到的不是一個巨大的神經(jīng)網(wǎng)絡(luò)而是一套可能由幾十條規(guī)則、幾個技能模塊構(gòu)成的“說明書”。這套說明書是人類可以閱讀、理解和修改的。3. 實現(xiàn)可解釋與可組合性的關(guān)鍵技術(shù)路徑理解了RELIC的思想我們來看看要實現(xiàn)它需要跨越哪些技術(shù)障礙以及可能的技術(shù)路徑是什么。這不僅僅是應(yīng)用某個現(xiàn)成的算法而是一套方法論。3.1 技能發(fā)現(xiàn)從連續(xù)軌跡中提取離散基元第一個挑戰(zhàn)是如何從連續(xù)、高維的動作-觀測軌跡中自動發(fā)現(xiàn)那些有意義的“技能”。這本質(zhì)上是一個時間序列分割與聚類問題。一種常見的方法是變分自編碼器VAE或它的時序版本。我們將軌跡片段例如過去k步的觀測和動作編碼到一個潛空間然后在潛空間中進(jìn)行聚類。屬于同一類的軌跡片段被認(rèn)為在執(zhí)行同一種技能。例如在多個智能體圍捕獵物的場景中算法可能會自動發(fā)現(xiàn)“迂回包抄”、“正面驅(qū)趕”、“合圍”等幾種不同的潛空間簇每個簇對應(yīng)一個技能。另一種思路是借鑒選項框架Option Framework。一個選項由三部分組成內(nèi)部策略執(zhí)行該技能時的低級策略、終止條件何時結(jié)束該技能、以及初始狀態(tài)集在何種狀態(tài)下可以啟動該技能。我們可以通過最大化軌跡的互信息或某種多樣性目標(biāo)來學(xué)習(xí)一組多樣化的選項。在多智能體場景中選項可以是單個智能體的也可以是聯(lián)合的多個智能體協(xié)同執(zhí)行一個選項。注意技能發(fā)現(xiàn)的粒度至關(guān)重要。技能太細(xì)如“向左移動一步”則失去了抽象意義可解釋性差技能太粗如“贏得比賽”則無法提供有效的規(guī)劃指導(dǎo)。通常需要根據(jù)任務(wù)先驗或通過分層學(xué)習(xí)來調(diào)整粒度。3.2 原理學(xué)習(xí)構(gòu)建可解釋的決策模型當(dāng)我們將軌跡表示為技能序列后下一步就是學(xué)習(xí)支配這些技能選擇的“原理”。這里的核心是選擇一個本身具備可解釋性的模型。決策樹與規(guī)則集這是最直接的可解釋模型。我們可以將環(huán)境狀態(tài)如智能體相對位置、資源數(shù)量、敵方狀態(tài)等作為特征將當(dāng)前要執(zhí)行的技能作為標(biāo)簽訓(xùn)練一個決策樹。生成的樹形結(jié)構(gòu)或“if-then”規(guī)則例如“如果友方A在目標(biāo)點(diǎn)5米內(nèi)且敵方B距離大于10米則執(zhí)行技能‘護(hù)送’”非常易于人類理解。集成方法如隨機(jī)森林可以提升性能但會犧牲部分可解釋性。線性模型與注意力機(jī)制對于技能選擇可能是一個分布的情況可以使用廣義線性模型并為不同的狀態(tài)特征賦予可解釋的權(quán)重。結(jié)合注意力機(jī)制可以進(jìn)一步揭示在決策時智能體“關(guān)注”了環(huán)境中的哪些關(guān)鍵實體或信息。例如注意力權(quán)重可以可視化出在決定“傳球”時智能體主要關(guān)注了接球隊員的位置和防守隊員的動向。時序邏輯與有限狀態(tài)機(jī)對于具有嚴(yán)格時序約束的任務(wù)線性時序邏輯LTL或信號時序邏輯STL是強(qiáng)大的描述工具。我們可以從軌跡中學(xué)習(xí)滿足特定任務(wù)需求的LTL公式。例如一個巡邏任務(wù)可能歸納出公式“始終巡視區(qū)域A 最終 巡視區(qū)域B”。有限狀態(tài)機(jī)FSM也是一種直觀的模型狀態(tài)代表宏觀階段轉(zhuǎn)移條件由可解釋的謂詞定義。概率圖模型如動態(tài)貝葉斯網(wǎng)絡(luò)DBN或隱馬爾可夫模型HMM可以建模技能之間的概率轉(zhuǎn)移關(guān)系以及它們對狀態(tài)觀測的依賴同時提供一定的不確定性度量。選擇哪種模型這取決于任務(wù)特性。決策樹適合離散特征和確定性策略時序邏輯適合有嚴(yán)格順序要求的任務(wù)概率圖模型適合存在大量不確定性和部分觀測的場景。在實踐中往往需要結(jié)合領(lǐng)域知識進(jìn)行選擇。3.3 組合與分層規(guī)劃用原理指導(dǎo)協(xié)作學(xué)習(xí)到技能和原理后我們需要將它們組合起來形成一個能解決原始任務(wù)的高層規(guī)劃器。這通常是一個分層規(guī)劃過程。高層規(guī)劃器以可解釋的原理模型如決策樹為核心。它接收當(dāng)前的環(huán)境狀態(tài)可能是經(jīng)過抽象的如“敵我力量對比”、“關(guān)鍵目標(biāo)點(diǎn)占領(lǐng)情況”然后根據(jù)原理輸出下一個要執(zhí)行的聯(lián)合技能如“執(zhí)行戰(zhàn)術(shù)Alpha”。技能控制器每個聯(lián)合技能對應(yīng)一個低層的、已經(jīng)訓(xùn)練好的控制器。這個控制器可以是一個小型的神經(jīng)網(wǎng)絡(luò)它接收更原始、更細(xì)粒度的觀測如每個智能體的精確坐標(biāo)、速度并輸出每個智能體的原始動作如力、速度指令。執(zhí)行與監(jiān)控技能控制器執(zhí)行該技能直到滿足技能的終止條件如“到達(dá)目標(biāo)點(diǎn)”或“持續(xù)時間結(jié)束”。同時高層規(guī)劃器持續(xù)監(jiān)控環(huán)境判斷是否需要根據(jù)原理中斷當(dāng)前技能并切換到另一個技能。這種分層結(jié)構(gòu)帶來了巨大優(yōu)勢可解釋性任何時刻我們都可以詢問高層規(guī)劃器“為什么選擇這個技能” 規(guī)劃器可以根據(jù)決策樹路徑或邏輯規(guī)則給出明確回答??山M合性新的任務(wù)可能只需要重新組合現(xiàn)有的技能庫并微調(diào)高層原理模型而無需從頭訓(xùn)練所有低級控制器。零樣本泛化與快速適應(yīng)面對略微變化的環(huán)境人類可以通過直接修改幾條高層規(guī)則來調(diào)整系統(tǒng)行為這比重新進(jìn)行數(shù)百萬步的強(qiáng)化學(xué)習(xí)試錯要快得多。4. 實戰(zhàn)挑戰(zhàn)與應(yīng)對策略讓RELIC從論文走向代碼將RELIC的思想落地到實際項目中會遇到一系列紙上談兵時不易察覺的挑戰(zhàn)。下面結(jié)合我個人的一些實驗經(jīng)驗談?wù)勱P(guān)鍵的實施難點(diǎn)和應(yīng)對思路。4.1 挑戰(zhàn)一技能邊界的模糊性與重疊在復(fù)雜任務(wù)中技能之間的邊界往往是模糊的。例如“進(jìn)攻”和“防守反擊”這兩個技能在軌跡表現(xiàn)上可能有大量重疊。強(qiáng)行進(jìn)行硬聚類會導(dǎo)致技能識別不準(zhǔn)進(jìn)而影響原理學(xué)習(xí)的質(zhì)量。應(yīng)對策略軟聚類與混合模型采用高斯混合模型GMM或使用軟分配的聚類方法允許一條軌跡片段以不同概率屬于多個技能。在后續(xù)的原理學(xué)習(xí)中可以引入技能選擇的概率分布。層次化技能構(gòu)建層次化的技能樹。底層是細(xì)粒度的基礎(chǔ)技能如“移動至點(diǎn)位”、“瞄準(zhǔn)”高層是由基礎(chǔ)技能組合而成的宏技能如“側(cè)翼突擊”。這樣既保證了底層技能的清晰性又滿足了高層任務(wù)的需求。利用先驗知識不完全依賴無監(jiān)督發(fā)現(xiàn)可以引入少量的人類示范或標(biāo)簽。例如讓專家對部分軌跡片段進(jìn)行技能標(biāo)注然后用半監(jiān)督學(xué)習(xí)的方法引導(dǎo)整個技能發(fā)現(xiàn)過程。4.2 挑戰(zhàn)二可解釋性與性能的權(quán)衡一個極度簡單的決策樹可能非常容易解釋但它的表達(dá)能力有限可能無法捕捉復(fù)雜的狀態(tài)-技能映射關(guān)系導(dǎo)致規(guī)劃性能下降。反之一個深度神經(jīng)網(wǎng)絡(luò)原理模型可能性能很好但又成了新的“黑盒”。應(yīng)對策略模型復(fù)雜度可控在決策樹學(xué)習(xí)中明確設(shè)置樹的深度、葉子節(jié)點(diǎn)最小樣本數(shù)等參數(shù)在可解釋性和擬合能力之間取得平衡??梢允褂贸杀緩?fù)雜度剪枝。局部可解釋性如果全局模型必須復(fù)雜如一個較大的神經(jīng)網(wǎng)絡(luò)可以轉(zhuǎn)而尋求局部可解釋性。例如使用LIME或SHAP等方法對單個決策點(diǎn)進(jìn)行解釋回答“在這個特定狀態(tài)下哪些因素最重要地影響了技能A的選擇”神經(jīng)符號結(jié)合采用神經(jīng)符號系統(tǒng)。用神經(jīng)網(wǎng)絡(luò)來處理高維原始輸入如圖像并將其輸出轉(zhuǎn)化為一組低維的、符號化的命題如“目標(biāo)可見”、“友方在身邊”然后用可解釋的邏輯規(guī)則基于這些符號命題進(jìn)行決策。這樣神經(jīng)網(wǎng)絡(luò)負(fù)責(zé)“感知”符號規(guī)則負(fù)責(zé)“推理”兩者各司其職。4.3 挑戰(zhàn)三多智能體信用分配與原理的耦合在多智能體環(huán)境中一個聯(lián)合技能的成功執(zhí)行是多個智能體共同作用的結(jié)果。學(xué)習(xí)原理時我們需要理解是哪個些智能體的狀態(tài)或動作觸發(fā)了技能切換這涉及到多智能體信用分配問題在技能層面的體現(xiàn)。應(yīng)對策略基于注意力的機(jī)制在原理模型中引入注意力機(jī)制。例如學(xué)習(xí)一個函數(shù)為每個智能體對當(dāng)前決策的重要性打分。這可以揭示在戰(zhàn)術(shù)執(zhí)行中誰是關(guān)鍵決策者或執(zhí)行者。可視化注意力權(quán)重圖是非常有力的解釋工具。差分貢獻(xiàn)度分析通過計算反事實查詢來評估單個智能體的貢獻(xiàn)。例如“如果智能體i當(dāng)時不在那個位置我們還會選擇執(zhí)行‘包抄’技能嗎” 通過系統(tǒng)地模擬這種反事實情況可以量化每個智能體對特定決策的影響。分解式原理不學(xué)習(xí)一個整體的聯(lián)合技能選擇原理而是為每個智能體學(xué)習(xí)一個局部原理再通過通信或共識機(jī)制進(jìn)行協(xié)調(diào)。這樣每個智能體的決策邏輯都是獨(dú)立可解釋的。4.4 一個簡化的代碼框架示意以下是一個高度簡化的、概念性的RELIC實現(xiàn)框架用于說明核心流程并非可直接運(yùn)行的代碼。import numpy as np from sklearn.tree import DecisionTreeClassifier from sklearn.cluster import KMeans # 假設(shè)我們已經(jīng)通過基礎(chǔ)MARL算法收集了大量軌跡數(shù)據(jù) # trajectories: list of episodes, each episode is a list of (global_state, joint_action, reward, done) tuples class RELICFramework: def __init__(self, n_skills5, skill_length10): self.n_skills n_skills self.skill_length skill_length self.skill_cluster KMeans(n_clustersn_skills) self.principle_model DecisionTreeClassifier(max_depth5) # 可解釋的原理模型 self.skill_library {} # 技能ID - 低級控制器可以是小神經(jīng)網(wǎng)絡(luò) def discover_skills(self, trajectories): 從軌跡中發(fā)現(xiàn)技能片段 skill_segments [] for traj in trajectories: for i in range(0, len(traj) - self.skill_length, self.skill_length//2): # 滑動窗口允許重疊 segment traj[i:iself.skill_length] # 將片段編碼為特征向量例如使用自編碼器的潛變量 segment_feature self._encode_segment(segment) skill_segments.append(segment_feature) skill_segments np.array(skill_segments) # 聚類每個簇代表一種技能 skill_labels self.skill_cluster.fit_predict(skill_segments) # 為每個技能簇訓(xùn)練一個低級控制器略 # self._train_low_level_controllers(trajectories, skill_labels) return skill_labels def learn_principles(self, trajectories, skill_labels): 學(xué)習(xí)技能選擇原理 X, y [], [] for traj, skill_seq in zip(trajectories, skill_labels): # 假設(shè)我們將軌跡按技能片段切分好了 for (state, _), skill_id in zip(traj, skill_seq): # 將原始狀態(tài)state轉(zhuǎn)換為可解釋的特征這一步很關(guān)鍵 interpretable_feature self._extract_interpretable_features(state) X.append(interpretable_feature) y.append(skill_id) self.principle_model.fit(X, y) # 現(xiàn)在我們可以可視化這棵決策樹它就是可解釋的原理 # from sklearn.tree import plot_tree # plot_tree(self.principle_model, feature_namesfeature_names) def plan(self, current_state): 基于學(xué)習(xí)到的原理進(jìn)行高層規(guī)劃 # 1. 提取可解釋特征 features self._extract_interpretable_features(current_state) # 2. 原理模型決策選擇技能ID skill_id self.principle_model.predict([features])[0] # 3. 調(diào)用對應(yīng)的低級技能控制器 low_level_actions self.skill_library[skill_id].execute(current_state) return low_level_actions, skill_id # 返回原始動作和可解釋的技能ID def _encode_segment(self, segment): # 實現(xiàn)軌跡片段編碼例如使用VAE的編碼器 pass def _extract_interpretable_features(self, state): # 實現(xiàn)從原始狀態(tài)到可解釋特征的轉(zhuǎn)換例如距離、角度、布爾標(biāo)志等 pass這個框架省略了無數(shù)細(xì)節(jié)如技能終止條件的學(xué)習(xí)、分層策略的端到端訓(xùn)練、信用分配等但它勾勒出了RELIC方法的核心循環(huán)發(fā)現(xiàn)技能 - 學(xué)習(xí)原理 - 組合規(guī)劃。5. 評估與展望如何衡量“可解釋性”的價值當(dāng)我們構(gòu)建了一個像RELIC這樣的系統(tǒng)后如何評估它性能如勝率、回報是基礎(chǔ)指標(biāo)但更重要的是評估其“可解釋性”和“可組合性”帶來的附加價值。5.1 可解釋性的評估指標(biāo)這是一個活躍的研究領(lǐng)域尚無金標(biāo)準(zhǔn)但可以從以下幾個維度衡量人類理解度進(jìn)行用戶研究。讓領(lǐng)域?qū)<一蚍菍<也榭聪到y(tǒng)生成的原理如決策樹、規(guī)則集然后回答關(guān)于系統(tǒng)行為的問題例如“在XX情況下系統(tǒng)會怎么做”“為什么它剛才做了那個決策”。計算回答的正確率。模擬干預(yù)與反事實查詢評估原理模型是否捕捉了真實的因果關(guān)系。通過修改原理模型中的某個條件例如在規(guī)則中將“距離5”改為“距離10”觀察模擬環(huán)境中系統(tǒng)行為的變化是否符合人類直覺。邏輯一致性檢查對于基于邏輯的原理可以自動檢查其是否滿足某些領(lǐng)域特定的約束或安全規(guī)范例如“永遠(yuǎn)不會同時執(zhí)行技能A和技能B”。簡潔性原理模型的復(fù)雜度如決策樹的節(jié)點(diǎn)數(shù)、規(guī)則集的條款數(shù)、邏輯公式的長度等。通常更簡潔的模型更容易理解。5.2 可組合性與泛化能力評估零樣本/少樣本任務(wù)遷移在訓(xùn)練任務(wù)上學(xué)習(xí)技能和原理后將其直接應(yīng)用于一個相關(guān)但不同的新任務(wù)觀察性能。例如在“2對2足球”中學(xué)到的技能和原理能否在“3對3足球”中通過簡單組合快速適應(yīng)這是衡量可組合性價值的關(guān)鍵。人工修改與快速調(diào)優(yōu)允許人類專家根據(jù)學(xué)到的原理直接修改幾條規(guī)則或添加一個新技能。然后評估系統(tǒng)在原始任務(wù)或新變體任務(wù)上的性能提升速度。與需要從頭強(qiáng)化學(xué)習(xí)的方法對比調(diào)優(yōu)效率。模塊化分析通過“拔出”或“替換”某個技能模塊觀察系統(tǒng)性能的衰減程度來分析技能模塊之間的耦合度和獨(dú)立性。一個好的可組合系統(tǒng)模塊間應(yīng)是松耦合的。5.3 未來方向與個人思考RELIC所代表的“可解釋、可組合的多智能體學(xué)習(xí)”方向我個人認(rèn)為將在以下方面持續(xù)深化與基礎(chǔ)模型結(jié)合利用大語言模型LLM或視覺基礎(chǔ)模型VLM強(qiáng)大的語義理解和生成能力。例如用LLM來為自動發(fā)現(xiàn)的技能進(jìn)行自然語言命名和描述甚至將人類用自然語言描述的高層指令直接編譯成可執(zhí)行的規(guī)劃原理。這將是實現(xiàn)人機(jī)自然交互協(xié)作的關(guān)鍵。在線學(xué)習(xí)與原理演化當(dāng)前的RELIC多基于離線數(shù)據(jù)學(xué)習(xí)靜態(tài)原理。未來的系統(tǒng)需要能在與環(huán)境持續(xù)交互中在線更新和演化其技能庫與原理適應(yīng)動態(tài)變化的環(huán)境??山忉屝缘摹岸取贬槍Σ煌挠脩粝到y(tǒng)設(shè)計者、監(jiān)管者、終端用戶提供不同層次和形式的解釋。例如給設(shè)計者看詳細(xì)的決策樹和權(quán)重給監(jiān)管者看合規(guī)性檢查報告給用戶看簡單的狀態(tài)描述和意圖說明。從“解釋已知”到“發(fā)現(xiàn)未知”可解釋性不僅用于理解已知策略更可用于發(fā)現(xiàn)人類未曾想到的、新穎有效的協(xié)作策略。通過分析學(xué)到的原理我們可能發(fā)現(xiàn)反直覺但高效的協(xié)作模式從而反哺人類對復(fù)雜系統(tǒng)協(xié)作的理解。在我自己的實踐中最大的體會是追求可解釋性不是給系統(tǒng)套上枷鎖而是為它安裝“儀表盤”和“方向盤”。一個只有油門和剎車的黑盒系統(tǒng)或許能在特定賽道上跑得很快但一旦偏離軌道或需要應(yīng)對復(fù)雜路況我們便無能為力。而RELIC這類工作正是在為多智能體系統(tǒng)打造這個至關(guān)重要的“儀表盤”和“方向盤”讓我們不僅能欣賞其性能更能理解、信任并有效地引導(dǎo)它。這條路很長但每一步都讓智能體離我們的真實世界更近一步。