如果把自進化 AI 放在整個 AI 發展的程序中來看,真正困難的並不是提出“讓 AI 自我進化”這個概念,而是如何讓這種進化真正發生論文。
一個 Agent 的實際表現,不僅取決於模型本身,更取決於包裹在模型外圍的「腳手架」——提示詞、注入的知識、執行時控制邏輯等論文。
讓模型自己修改這些程式碼看似簡單,真正的難點卻在於如何避免過擬合:模型自我生成的反饋往往充滿噪聲,一個看似有效的修改,可能只是針對特定測試集的過擬合,換個場景就會導致災難性崩潰論文。
技能(Skills)的規模化管理,是第二道關卡論文。
當 Agent 把成功經驗固化為可複用的技能檔案論文,技能數量會爆炸式增長,那麼如何管理這些碎片化、冗餘、質量參差不齊的技能?又如何在一個數十萬量級的技能庫中,精準檢索出當前任務真正需要的那幾個?
這類工程問題長期被學術界忽視,卻恰恰是產品能否落地的關鍵論文。
模型權重(Weights)的訓練訊號分配,是第三道關卡論文。
在最底層的模型訓練階段,同策略自我蒸餾(On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段論文。
但傳統 OPSD 在處理長序列推理時,會把相同的監督權重均勻分配給每一個生成步驟,完全忽略了錯誤發生的時序上下文論文。這就像長跑時,無論你在起跑摔倒還是在終點前摔倒,教練的懲罰都一模一樣。
如此粗顆粒度的訊號分配,嚴重拖累了模型的學習效率論文。
EverMind 的三篇論文,正是分別瞄準這三道難關,各自給出了嚴謹的解法論文。
HarnessBank論文:讓 Agent 學會安全改寫「腳手架」
在實際部署中,模型權重往往是凍結的,修改 Agent 外圍的 Harness 成為了提升效能的最直接手段論文。
EverMind 在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》一文中論文,提出了一套全新的框架:
它能夠讓 Agent 自主診斷失敗並重寫自己的執行邏輯,同時從根本上解決了自我改進中的過擬合問題論文。
展開全文
這套框架的核心創新在於將“提出變更”與“歸因變更”徹底分離論文。
在過去的研究中,模型既當運動員又當裁判,自己寫程式碼自己評估,極易產生幻覺式的效能提升論文。
而在 EverMind 的方案中,語言模型只負責診斷失敗原因並提出補丁(Patch),所有的取樣、測量和顯著性檢驗全部交由確定性的程式碼邏輯來控制論文。
這一設計確保了每一個被系統認可的效能提升,在統計意義上都是絕對可靠的,而非測量誤差或隨機波動論文。
更有創新性的是其引入的裝備基因庫(Harness Gene Bank, HGB)機制論文。
傳統的自進化系統往往以“任務”為鍵(Key)來儲存改進,這極易導致系統只學會瞭如何解決特定的幾道題,換一個場景便原形畢露論文。
EverMind 則將每一份高效能腳手架以“WHERE × WHY”(改動作用在哪個環節、又是為何被引入)作為語義座標存檔,並支援透過故障診斷進行“重新發明”,或跨單元進行“機制重組”,防止搜尋過程陷入崩潰或原地打轉論文。
這種設計引入了強大的抗過擬合歸納偏置——系統學到的不是“如何解決這道題”,而是“如何修復這類病理”論文。
為了從大量候選後代腳手架中高效挑出真正有效的改進,團隊還設計了分級裝備篩選(Gated Harness Screening)機制,用有效性、啟用、配對顯著性、增益四道順序閘門層層過濾,兼顧了評估成本與結果的可信度論文。
實驗結果證明了這一設計的有效性論文。
團隊預設以 Qwen3.6-27B 作為任務 Agent、Claude Opus 4.8 作為進化 Agent,在 Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench 七個多樣化基準上評測,並與 GEPA、DGM(Darwin Gödel Machine)兩種當前最先進的自進化方法對比論文。
結果顯示,在凍結任務 Agent 權重的情況下,HarnessBank 在全部七個基準上取得了 5.1%到 15.4%的一致效能提升論文。
同時所有增益均透過了配對顯著性檢驗(z≥1.96),證明這些提升在統計意義上絕對可靠,而非測量誤差或隨機波動論文。
論文中還有一個極具啟發性的發現:
跨模型實驗證實,這些效能提升來自模型特異性的自進化過程,而不是存在某個放之四海而皆準的“萬能腳手架”論文。
獲勝的補丁追蹤的是模型的主導“病理”,而不是模型的大小或家族論文。
也就是說,當你更換一個不同的基礎模型時,主導病理會改變,對應的最優腳手架也會隨之改變;但同樣的病理-補丁匹配關係,會在不同的模型家族中重複出現論文。
這意味著,EverMind 構建的這套“診斷-歸因”迴圈機制,是一種可以跨模型遷移的元能力,證明了 AI for AI 的技術可行性論文。
SkillCorpus論文:10 萬技能庫背後的工程與科學
如果說 Harness 的自進化賦予了 Agent 重寫邏輯的能力,那麼“技能”(Skills)則是 Agent 沉澱經驗的具體載體論文。
在 EverMind 的 Raven 框架中,內建了高達 10 萬項開箱即用的技能論文。
這並非簡單的數量堆砌,其背後的工程與科學支撐,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》論文。
隨著開源社羣中技能檔案(如 Skill.md 格式)的爆發式增長,這些資產呈現出嚴重的碎片化、冗餘和質量不均論文。
EverMind 團隊構建了一個名為 SkillCorpus 的框架,首次在規模化層面上對開放技能生態進行了聚合、策展、匹配和評估論文。
這個過程堪稱一場浩大的數字淘金論文。
團隊從爬取的大約 82.1 萬個原始技能中,透過多階段多維度策略過濾,最終精選出 96401 個高質量技能論文。
為了管理這些技能,他們建立了一個包含 16 個類別的分類法,並從實用性(Utility)、魯棒性(Robustness)和安全性(Safety)三個維度進行了嚴格的質量控制論文。
僅僅有庫還不夠,關鍵在於檢索論文。
EverMind 配合這個龐大的語料庫,微調了一套專門的檢索與選擇技術棧,確保 Agent 在執行任務時能夠精準匹配到相關的技能論文。
SkillsBench、GDPVal 和 QwenClawBench 三個基準測試中的端到端評估顯示,自研的 Raven Harness 整合 SkillCorpus 後,Agent 在所有基準上均獲得了穩定的效能提升,其中在 SkillsBench 上的提升最大,達到了 7.5 個百分點論文。
透過深入的運營分析論文,團隊還識別出了技能帶來的增益邊界——
覆蓋邊界(技能庫是否覆蓋了任務所需的知識)和 Harness 邊界(Agent 的腳手架是否能有效呼叫技能),這為未來如何進一步最佳化技能檢索和應用指明瞭方向論文。
這篇論文不僅是對 Raven 10 萬技能庫的技術解密,更是業界首個關於“經過策展和檢索服務的社羣技能庫如何在真實 Agent 任務中發揮作用”的端到端系統性研究論文。
更進一步,技能並非一入庫就固定不變論文。
無論是人工編寫的技能,還是 AI 自動生成的技能,EverOS 都能依據任務執行的成敗經驗對其持續打磨論文。
用得好的被強化、被複用,用得差的被修正、被淘汰論文。
技能庫因此不是一份靜態清單,而是一個隨任務不斷自我進化、越用越強的資產,這也正是技能沉澱歸屬於任務層的原因所在論文。
DASH論文:讓模型看清哪裡出了錯
自進化的最深層,是模型權重的自我迭代論文。
EverMind 的最新論文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》,展示了其在底層演算法上的深厚功底論文。
傳統的同策略自我蒸餾(OPSD)存在一個致命的時間盲區論文:
它對所有區域性散度(即學生與教師的差異)分配相同的係數,完全忽略了錯誤發生的時間順序和上下文論文。
EverMind 的研究團隊透過對大量真實推理軌跡的分析,發現了一個關鍵現象:在一個推理序列中,區域性散度值的大小與未來散度的演變之間,存在極弱的關聯論文。
這意味著,用同一個係數來處理所有時間步的散度,本質上是在用一把尺子量所有不同形狀的錯誤,必然導致監督訊號的嚴重失真論文。
為了解決這一問題,EverMind 提出了 DASH(Divergence-Adaptive Supervision Horizons)論文。
DASH 的核心思想是將每個區域性蒸餾訊號與序列級均值之間的差距,轉化為一個自適應的傳播門(Propagation Gate),然後利用這些門控制向後的多步聚合論文。
當一個時間步的區域性散度高於序列均值時,說明這裡是一個高風險分叉點,DASH 會開啟一個更大的傳播門,讓這個時間步的監督訊號向前傳播更遠;反之,傳播門收窄,避免無關緊要的步驟干擾整體學習論文。
實驗結果令人印象深刻論文。
在 AIME 2024、AIME 2025 和 HMMT 2025 三個極具挑戰性的數學推理基準上,DASH 在 Qwen3-1.7B、Qwen3-4B 和 Qwen3-8B 三個模型規模上均取得了所有對比方法中的最高分論文。
在 Qwen3-1.7B 上,DASH 將三個基準的平均得分從 vanilla OPSD 的 41.87 提升至 45.07;在 Qwen3-8B 上,從 65.00 提升至 66.40論文。
更重要的是,DASH 不需要引入任何額外的教師或學生前向傳遞開銷,這意味著這種效能提升幾乎是免費的論文。
EverMind 的自進化框架全景
在長期記憶領域已經貢獻了數篇 ACL、KDD 等頂會高質量論文,並取得開源庫 1.8 萬 star 後,EverMind 繼續分享對自進化演進的研究成果——
將自進化的完整路徑,概括為一個從任務層到元改進層的四層遞進體系論文。
上述三篇論文構成的技術棧論文,與 EverMind 內部的產品和研究框架之間,存在著精密的對映關係:
1、任務層論文:
任務層是最直接的進化層次,進化在單次任務中即時發生論文。
最佳化物件是單次任務的執行質量,既包括記憶的提取與回寫,也包括技能(Skills)的即時沉澱與複用;經驗來源是 Context、Trace 與使用者反饋,更新動作是即時回寫,驗證方式是結果與反饋論文。
這一層的能力複利是“記得更牢、用得更順、單次任務做得更好”,價值定位是沉澱任務級、可複用的記憶與技能資產論文。
這正是 EverOS 與 SkillCorpus 所覆蓋的核心場景論文。
2、腳手架層論文:
腳手架層(Harness)最佳化物件是 Code 與 Policy,即 Agent 外圍的執行邏輯與控制策略;經驗來源是 Eval 與 Reflection,更新動作是腳手架的版本迭代,驗證方式是 Agent Evals 覆盤論文。
這一層的能力複利是“更會執行”,價值定位是可複用行為資產的持續積累論文。
這正是 Raven 框架與 Self-Evolving Harness 論文所對應的工作論文。
3、模型層論文:
模型層最佳化物件是模型本身,經驗來源是高價值軌跡、偏好與失敗樣本,更新動作是 LoRA 與端側模型的驗證後灰度,驗證方式是離線集加灰度測試論文。
這一層的能力複利是“更準、更省”,價值定位是個性化的專屬模型能力論文。DASH 論文正是這一層的核心演算法支撐。
4、元改進層論文:
元改進層是整個框架最令人興奮的頂層論文。
最佳化物件是 Evaluator、Data 與 Training Recipe 本身,經驗來源是多輪實驗與 Benchmark,更新動作是最佳化“提出—選擇—驗證”的整個迴圈,驗證方式是版本門檻加評測體系論文。
這一層的能力複利是“下一輪進化更快、更可靠”,價值定位是讓改進能力本身也持續升級論文。
這個四層框架的深刻之處在於,它把自進化拆成了四個層層遞進又彼此支撐的環節,併為每一層都配備了具體的技術路徑與驗證機制論文。
它不是一張空洞的願景圖,而是一個有工程細節、有學術支撐的完整路線圖論文。
其實在今年 4 月,團隊就率先提出了針對 Agent 自進化的評測基準 EvoAgentBench,當月在 Hugging Face 同類 benchmark 上下載量第一論文。
這是一套用於衡量智慧體從既往執行中提取並遷移能力效果的評測方法,為技能沉澱、腳手架迭代和模型最佳化提供統一、可比較的驗證框架論文。
結合三篇論文從技術、腳手架到模型權重的系統性探索,EverMind 已將自進化能力建設由方法研究延伸至評測體系,形成更完整的技術閉環論文。
從腳手架,到技能,再到模型權重;從任務層,到腳手架層、模型層,再到元改進層,EverMind正在將自進化能力建設逐步延伸論文。
三篇論文,也由此構成了一條從不同層面探索 AI 自進化的完整路徑論文。
而這,正是 EverMind 交出的 AI 全棧自進化首份答卷論文。