允中 發自 凹非寺
量子位 | 公眾號 QbitAI
2026年夏天,註定是自進化AI的歷史一刻論文。
當海外NeoLab還忙於靠敘事拿下數億美元融資時,一家中國團隊用連續三篇論文,交出了自進化AI領域第一份全棧答案論文。
它就是EverMind,由盛大集團孵化,延襲當年創新院研究基因論文。
其實回顧中國網際網路史,盛大創新院的存在幾乎算得上「異類」論文。
2008年,陳天橋在盛大集團內部創立該機構,其定位不是做產品、也不追KPI,就是純粹地探索技術前沿論文。
這在那個流量為王、變現至上的網際網路時代,其實是一種極為罕見的企業內研究文化論文。
彼時,這種模式在中國企業界幾乎是開創性的論文。
十餘年後,時代的底色已經從網際網路切換到了AI論文。
而盛大集團的戰略佈局論文,也已經集中到更為前沿的腦科學和人工智慧方向——
近三年來,盛大All in AI,在原有風險投資體系基礎上,透過內部孵化機制在全球範圍內廣泛吸引頂尖AI人才,陸續孵化出多支專注於不同AI方向的研究型團隊論文。
EverMind,正是其中一支論文。
如果說盛大創新院開創了中國企業內研究型組織的先河,那麼EverMind的出現,則是這一基因在AI時代的延續與昇華論文。
也正因如此論文,這支團隊從一開始便選擇了一條在商業上看似“最難”、在技術上卻“最根本”的路:
展開全文
解決AI的長期記憶問題,並在此基礎上,探索AI的自進化之路論文。
放至2026年的AI版圖上,這個模式有了一個更為響亮的名字——NeoLab(新一代AI實驗室)論文。
海外團隊紛紛下注論文,NeoLab浪潮狂飆
NeoLab這個詞,最早是被用來描述那批從OpenAI、Google DeepMind、Meta等頂級AI機構出走、押注前沿技術方向獨立創業的研究型團隊論文。
他們的共同特徵是:面向下一代AI技術、研究驅動和長期主義論文。
2026年論文,這股浪潮已經洶湧到了無法忽視的程度:
比如,前Salesforce首席科學家Richard Socher與前Meta FAIR科學家總監田淵棟聯合創立的Recursive Superintelligence(RSI)論文。
其在團隊不足30人、尚無任何產品的情況下,拿到了6.5億美元融資,估值高達46.5億美元,並隨即與AWS簽署了4.1億美元的多年算力合作協議論文。
DeepMind的AlphaGo之父David Silver帶著Ineffable Intelligence以51億美元估值殺入戰局論文。
Engram以6億美元估值完成了9800萬美元A輪融資論文,Adaption Labs以10億美元估值拿到了5000萬美元種子輪,Core Automation的估值目標直指40億美元……
這些團隊押注的核心命題,都指向同一個方向:如何讓AI在部署後不再是一成不變的靜物,而是能夠透過自我迭代實現持續進化論文。
這個方向,在學術上被稱為遞迴自我改進(Recursive Self-Improvement),在產業上被稱為自進化AI(Self-Evolving AI)論文。
然而論文,當我們仔細審視這些估值驚人的NeoLab時,會發現他們大多仍停留在單點突破的理論探索階段:
RSI:初步分享了先進的理念和路線設計論文,但尚未公佈具體方案或成果;
Engram:專注於引數化權重記憶論文,但缺乏腳手架層的靈活進化機制;
Adaption Labs:主攻推理時適應論文,但沒有長期技能沉澱體系;
Core Automation:方向最為接近,但也還沒有公開的論文和開源生態論文。
就在海外團隊還在各自的細分領域摸索時論文,EverMind悄然完成了一件令人矚目的事:
連續釋出三篇重量級論文,從技能層、腳手架層到模型權重層,系統性地給出了一套完整的自進化AI技術答案論文。
一次對話論文,兩個入口:當RSI遇上EverMind
在深入這三篇論文之前,有一個細節值得單獨記錄論文。
今年四月,EverMind主辦了一場名為“記憶起源”(Memory Origins)的Hackathon活動論文。
在這場活動上,出現了一位特別的嘉賓——Recursive Superintelligence(RSI)的聯合創始人之一,田淵棟論文。
田淵棟在活動上分享了他對AI記憶工作的深度理解,而彼時RSI融資的相關進展尚未披露論文。
在活動結束後,田淵棟與EverMind負責人鄧亞峰共同接受了「矽谷創見匯」播客的採訪,兩人就AI行業的發展走向和記憶相關技術的前景進行了深入對談論文。
在這次對話中論文,鄧亞峰提出了一個核心判斷,也透露了EverMind技術戰略的脈絡:
從長期記憶,結合持續學習,走向自我進化是下一代AI的核心技術路線論文。
這句話值得細細品味論文。
記憶,是Agent積累經驗的載體;自進化,是把經驗轉化為能力躍升的路徑論文。
沒有高質量的記憶,自進化就是無源之水;沒有自進化作為目標,記憶就只是一個越來越大的檔案館論文。
EverMind從EverOS(記憶作業系統)到Raven(自進化Agent框架),再到三篇自進化論文所構建的完整技術棧,正是這一判斷的系統性實踐論文。
田淵棟與鄧亞峰在同一個舞臺上的相遇,某種程度上也是一個隱喻:
當海外最頂尖的自進化研究者,與中國最具研究深度的記憶AI團隊相遇,他們發現彼此正在從不同的入口,攀登同一座山峰論文。
為什麼「自進化」重要且難論文?
在深入EverMind的技術細節之前,還需想清楚一件事:為什麼“讓AI自我進化”既是必答題,又是一道難題論文。
傳統大語言模型一旦完成訓練並部署,能力就被凍結了,不再隨使用而增長論文。可人類智慧最迷人的地方恰恰相反——每一次交流、每一次思考,我們都在悄然進化。
下一代AI也理應如此:能夠透過持續學習不斷變得更聰明,而不是停在出廠那一刻論文。
而且這條路正在變得現實論文。
隨著大模型能力的躍升,越來越多的案例表明,“AI自主改進AI”已經從設想走向可行,在某些環節甚至開始超越人類專家論文。
一旦AI能夠穩定地自我改進,隨之而來的很可能是一場生產力的躍遷論文。
但要真正做到這一點並不容易論文。業界通常有三條路徑,每一條都橫著一道難關。
腳手架(Harness)的自我改進,是第一道關卡論文。
一個Agent的實際表現,不僅取決於模型本身,更取決於包裹在模型外圍的「腳手架」——提示詞、注入的知識、執行時控制邏輯等論文。
讓模型自己修改這些程式碼看似簡單,真正的難點卻在於如何避免過擬合:模型自我生成的反饋往往充滿噪聲,一個看似有效的修改,可能只是針對特定測試集的過擬合,換個場景就會導致災難性崩潰論文。
技能(Skills)的規模化管理,是第二道關卡論文。
當Agent把成功經驗固化為可複用的技能檔案論文,技能數量會爆炸式增長,那麼如何管理這些碎片化、冗餘、質量參差不齊的技能?又如何在一個數十萬量級的技能庫中,精準檢索出當前任務真正需要的那幾個?
這類工程問題長期被學術界忽視,卻恰恰是產品能否落地的關鍵論文。
模型權重(Weights)的訓練訊號分配,是第三道關卡論文。
在最底層的模型訓練階段,同策略自我蒸餾(On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段論文。
但傳統OPSD在處理長序列推理時,會把相同的監督權重均勻分配給每一個生成步驟,完全忽略了錯誤發生的時序上下文論文。這就像長跑時,無論你在起跑摔倒還是在終點前摔倒,教練的懲罰都一模一樣。
如此粗顆粒度的訊號分配,嚴重拖累了模型的學習效率論文。
EverMind的三篇論文,正是分別瞄準這三道難關,各自給出了嚴謹的解法論文。
HarnessBank論文:讓Agent學會安全改寫「腳手架」
在實際部署中,模型權重往往是凍結的,修改Agent外圍的Harness成為了提升效能的最直接手段論文。
EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(論文,提出了一套全新的框架:
它能夠讓Agent自主診斷失敗並重寫自己的執行邏輯,同時從根本上解決了自我改進中的過擬合問題論文。
這套框架的核心創新在於將“提出變更”與“歸因變更”徹底分離論文。
在過去的研究中,模型既當運動員又當裁判,自己寫程式碼自己評估,極易產生幻覺式的效能提升論文。
而在EverMind的方案中,語言模型只負責診斷失敗原因並提出補丁(Patch),所有的取樣、測量和顯著性檢驗全部交由確定性的程式碼邏輯來控制論文。
這一設計確保了每一個被系統認可的效能提升,在統計意義上都是絕對可靠的,而非測量誤差或隨機波動論文。
更有創新性的是其引入的裝備基因庫(Harness Gene Bank, HGB)機制論文。
傳統的自進化系統往往以“任務”為鍵(Key)來儲存改進,這極易導致系統只學會瞭如何解決特定的幾道題,換一個場景便原形畢露論文。
EverMind則將每一份高效能腳手架以“WHERE × WHY”(改動作用在哪個環節、又是為何被引入)作為語義座標存檔,並支援透過故障診斷進行“重新發明”,或跨單元進行“機制重組”,防止搜尋過程陷入崩潰或原地打轉論文。
這種設計引入了強大的抗過擬合歸納偏置——系統學到的不是“如何解決這道題”,而是“如何修復這類病理”論文。
為了從大量候選後代腳手架中高效挑出真正有效的改進,團隊還設計了分級裝備篩選(Gated Harness Screening)機制,用有效性、啟用、配對顯著性、增益四道順序閘門層層過濾,兼顧了評估成本與結果的可信度論文。
實驗結果證明了這一設計的有效性論文。
團隊預設以Qwen3.6-27B作為任務Agent、Claude Opus 4.8作為進化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七個多樣化基準上評測,並與GEPA、DGM(Darwin Gödel Machine)兩種當前最先進的自進化方法對比論文。
結果顯示,在凍結任務Agent權重的情況下,HarnessBank在全部七個基準上取得了5.1%到15.4%的一致效能提升論文。
同時所有增益均透過了配對顯著性檢驗(z≥1.96),證明這些提升在統計意義上絕對可靠,而非測量誤差或隨機波動論文。
論文中還有一個極具啟發性的發現論文:
跨模型實驗證實,這些效能提升來自模型特異性的自進化過程,而不是存在某個放之四海而皆準的“萬能腳手架”論文。
獲勝的補丁追蹤的是模型的主導“病理”,而不是模型的大小或家族論文。
也就是說,當你更換一個不同的基礎模型時,主導病理會改變,對應的最優腳手架也會隨之改變;但同樣的病理-補丁匹配關係,會在不同的模型家族中重複出現論文。
這意味著,EverMind構建的這套“診斷-歸因”迴圈機制,是一種可以跨模型遷移的元能力,證明了AI for AI的技術可行性論文。
SkillCorpus論文:10萬技能庫背後的工程與科學
如果說Harness的自進化賦予了Agent重寫邏輯的能力,那麼“技能”(Skills)則是Agent沉澱經驗的具體載體論文。
在EverMind的Raven框架中,內建了高達10萬項開箱即用的技能論文。
這並非簡單的數量堆砌,其背後的工程與科學支撐,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(論文。
隨著開源社羣中技能檔案(如Skill.md格式)的爆發式增長,這些資產呈現出嚴重的碎片化、冗餘和質量不均論文。
EverMind團隊構建了一個名為SkillCorpus的框架,首次在規模化層面上對開放技能生態進行了聚合、策展、匹配和評估論文。
這個過程堪稱一場浩大的數字淘金論文。
團隊從爬取的大約82.1萬個原始技能中,透過多階段多維度策略過濾,最終精選出96401個高質量技能論文。
為了管理這些技能,他們建立了一個包含16個類別的分類法,並從實用性(Utility)、魯棒性(Robustness)和安全性(Safety)三個維度進行了嚴格的質量控制論文。
僅僅有庫還不夠,關鍵在於檢索論文。
EverMind配合這個龐大的語料庫,微調了一套專門的檢索與選擇技術棧,確保Agent在執行任務時能夠精準匹配到相關的技能論文。
SkillsBench、GDPVal和QwenClawBench三個基準測試中的端到端評估顯示,自研的Raven Harness整合SkillCorpus後,Agent在所有基準上均獲得了穩定的效能提升,其中在SkillsBench上的提升最大,達到了7.5個百分點論文。
覆蓋邊界(技能庫是否覆蓋了任務所需的知識)和Harness邊界(Agent的腳手架是否能有效呼叫技能),這為未來如何進一步最佳化技能檢索和應用指明瞭方向論文。
這篇論文不僅是對Raven 10萬技能庫的技術解密,更是業界首個關於“經過策展和檢索服務的社羣技能庫如何在真實Agent任務中發揮作用”的端到端系統性研究論文。
更進一步,技能並非一入庫就固定不變論文。
無論是人工編寫的技能,還是AI自動生成的技能,EverOS都能依據任務執行的成敗經驗對其持續打磨論文。
用得好的被強化、被複用,用得差的被修正、被淘汰論文。
技能庫因此不是一份靜態清單,而是一個隨任務不斷自我進化、越用越強的資產,這也正是技能沉澱歸屬於任務層的原因所在論文。
DASH論文:讓模型看清哪裡出了錯
自進化的最深層,是模型權重的自我迭代論文。
EverMind的最新論文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》(論文。
傳統的同策略自我蒸餾(OPSD)存在一個致命的時間盲區論文:
它對所有區域性散度(即學生與教師的差異)分配相同的係數,完全忽略了錯誤發生的時間順序和上下文論文。
EverMind的研究團隊透過對大量真實推理軌跡的分析,發現了一個關鍵現象:在一個推理序列中,區域性散度值的大小與未來散度的演變之間,存在極弱的關聯論文。
這意味著,用同一個係數來處理所有時間步的散度,本質上是在用一把尺子量所有不同形狀的錯誤,必然導致監督訊號的嚴重失真論文。
為了解決這一問題,EverMind提出了DASH(Divergence-Adaptive Supervision Horizons)論文。
DASH的核心思想是將每個區域性蒸餾訊號與序列級均值之間的差距,轉化為一個自適應的傳播門(Propagation Gate),然後利用這些門控制向後的多步聚合論文。
當一個時間步的區域性散度高於序列均值時,說明這裡是一個高風險分叉點,DASH會開啟一個更大的傳播門,讓這個時間步的監督訊號向前傳播更遠;反之,傳播門收窄,避免無關緊要的步驟干擾整體學習論文。
實驗結果令人印象深刻論文。
在AIME 2024、AIME 2025和HMMT 2025三個極具挑戰性的數學推理基準上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三個模型規模上均取得了所有對比方法中的最高分論文。
在Qwen3-1.7B上,DASH將三個基準的平均得分從vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,從65.00提升至66.40論文。
更重要的是,DASH不需要引入任何額外的教師或學生前向傳遞開銷,這意味著這種效能提升幾乎是免費的論文。
EverMind的自進化框架全景
△EverMind的自進化之路(四層框架)
在長期記憶領域已經貢獻了數篇ACL、KDD等頂會高質量論文論文,並取得開源庫1.8萬star後,EverMind繼續分享對自進化演進的研究成果——
將自進化的完整路徑,概括為一個從任務層到元改進層的四層遞進體系論文。
上述三篇論文構成的技術棧論文,與EverMind內部的產品和研究框架之間,存在著精密的對映關係:
1、任務層論文:
任務層是最直接的進化層次,進化在單次任務中即時發生論文。
最佳化物件是單次任務的執行質量,既包括記憶的提取與回寫,也包括技能(Skills)的即時沉澱與複用;經驗來源是 Context、Trace 與使用者反饋,更新動作是即時回寫,驗證方式是結果與反饋論文。
這一層的能力複利是“記得更牢、用得更順、單次任務做得更好”,價值定位是沉澱任務級、可複用的記憶與技能資產論文。
這正是EverOS與SkillCorpus所覆蓋的核心場景論文。
2、腳手架層論文:
腳手架層(Harness)最佳化物件是Code與Policy,即Agent外圍的執行邏輯與控制策略;經驗來源是Eval與Reflection,更新動作是腳手架的版本迭代,驗證方式是Agent Evals覆盤論文。
這一層的能力複利是“更會執行”,價值定位是可複用行為資產的持續積累論文。
這正是Raven框架與Self-Evolving Harness論文所對應的工作論文。
3、模型層論文:
模型層最佳化物件是模型本身,經驗來源是高價值軌跡、偏好與失敗樣本,更新動作是LoRA與端側模型的驗證後灰度,驗證方式是離線集加灰度測試論文。
這一層的能力複利是“更準、更省”,價值定位是個性化的專屬模型能力論文。DASH論文正是這一層的核心演算法支撐。
4、元改進層論文:
元改進層是整個框架最令人興奮的頂層論文。
最佳化物件是Evaluator、Data與Training Recipe本身,經驗來源是多輪實驗與Benchmark,更新動作是最佳化“提出—選擇—驗證”的整個迴圈,驗證方式是版本門檻加評測體系論文。
這一層的能力複利是“下一輪進化更快、更可靠”,價值定位是讓改進能力本身也持續升級論文。
這個四層框架的深刻之處在於,它把自進化拆成了四個層層遞進又彼此支撐的環節,併為每一層都配備了具體的技術路徑與驗證機制論文。
它不是一張空洞的願景圖,而是一個有工程細節、有學術支撐的完整路線圖論文。
其實在今年4月,團隊就率先提出了針對Agent自進化的評測基準EvoAgentBench,當月在Hugging Face同類benchmark上下載量第一論文。
這是一套用於衡量智慧體從既往執行中提取並遷移能力效果的評測方法,為技能沉澱、腳手架迭代和模型最佳化提供統一、可比較的驗證框架論文。
結合三篇論文從技術、腳手架到模型權重的系統性探索,EverMind已將自進化能力建設由方法研究延伸至評測體系,形成更完整的技術閉環論文。
對比海外座標系論文,EverMind走到了哪一步?
要理解EverMind這套完整技術棧的領先性,我們不妨將目光投向海外那些估值令人咋舌的NeoLab論文。
Recursive Superintelligence(RSI)提出了宏大的“自動化AI研究閉環”理念,並拿到了6.5億美元融資和AWS的4.1億美元算力合作協議論文。
其第一階段目標是訓練一個具備“5萬名博士”能力的系統來自動化AI科學研究本身論文。
然而,RSI目前仍處於純研發階段,尚無成型的產品或框架落地,其公開結果僅限於在GPU核心演算法最佳化基準上超越了人類兩年的最佳化記錄論文。
Engram以6億美元估值完成了9800萬美元A輪融資,其核心技術是基於稀疏記憶模組的引數化權重記憶(如LoRA微調)論文。
Engram在降低推理成本和解決災難性遺忘方面做出了出色工作,但其路徑過於依賴底層權重的更新,缺乏在Agent腳手架(Harness)和外部技能庫層面的靈活進化機制,且需要白盒訪問模型權重,這在實際部署中是一個重大限制論文。
Adaption Labs(估值10億美元)主攻無梯度推理時適應,試圖透過動態解碼和介面卡組合來消除微調和提示詞工程論文。
這在思路上與EverMind的Harness自進化有相似之處,但Adaption Labs缺乏如SkillCorpus這樣龐大且經過策展的外部經驗沉澱體系,也沒有在底層訓練演算法上進行深度最佳化論文。
Core Automation(估值目標40億美元)由前OpenAI研究副總裁Jerry Tworek創立,其旗艦專案Ceres專注於持續學習模型,目標是將訓練資料需求降低100倍論文。
這是與EverMind方向最為接近的專案,但Core Automation目前仍在早期研發階段,缺乏EverMind這樣完整的技術棧和開源生態論文。
相比之下,EverMind的獨特之處在於其“三層併發”的戰略縱深論文。
它沒有陷入「引數化記憶」與「非引數化記憶」的非此即彼的爭論,而是透過EverOS(非引數化長期記憶)、Raven(Harness自進化)和DASH(底層權重訓練最佳化)構建了一個全棧生態論文。
更重要的是,EverMind堅持開源優先,透過在GitHub上積累的超過1.2萬顆Star(同期mem0為7千),正在迅速建立起類似Android的底層開發者生態護城河論文。
屬於中國NeoLab的時刻到了
再往前論文,EverMind團隊相信:
下一代AI,必然是一個能記住使用者偏好、越用越聰明的AI論文。
以長期記憶累積經驗,以持續學習改進模型,真正走向AI的全棧自我進化,將是這一代AI最重要的技術路線論文。
這條路線一旦被打通,無論是數字世界裡的Agent、物理世界中的具身機器人,還是整個AI for Science領域,都將被深刻改變論文。
在網際網路時代,盛大創新院曾是中國企業內研究文化的先行者,被後來的網際網路及各領域巨頭紛紛效仿;在AI時代,EverMind也正在成為中國NeoLab浪潮中最具研究深度的代表之一論文。
僅僅一年間,團隊就在長期記憶與自進化領域產出9篇高質量論文,其中數篇被ACL、KDD等頂會錄用論文。
這意味著EverMind的自進化不只是一個工程化產品論文,更有紮實的底層技術與嚴謹的學術支撐:
DASH讓模型在訓練時“看清自己錯在哪裡”,Self-Evolving Harness讓Agent在執行時安全地重寫自身邏輯,SkillCorpus讓Agent的成功經驗被規模化地沉澱與複用論文。
三者合一,構成了一個從「感知錯誤」到「修改邏輯」再到「沉澱記憶」的完整自進化閉環論文。
但這條路,EverMind並不想獨自走完,團隊誠摯邀請各領域的夥伴與之同行,一起共同構建AI長期記憶的基礎設施,把持續學習與自我進化推向科學、具身、金融、智慧硬體等更廣闊的場景論文。
在定義「數字生命」下一個形態的道路上,中國的研究型團隊,已經來了論文。
至於更精彩的部分,才剛剛開始論文。
HarnessBank論文連結論文:
SkillCorpus論文連結論文:
DASH論文連結論文:
*本文系量子位獲授權刊載,觀點僅為原作者所有論文。