EverMemOS 拆解:三層記憶點樣接住跨日工作,又點解未能完全放手
Tech News

EverMemOS 拆解:三層記憶點樣接住跨日工作,又點解未能完全放手

圖片:via TechNews 科技新報 — https://finance.technews.tw/2026/07/15/evermemos-a-self-organizing-memory-operating-system-for-structured-long-horizon-reasoning/
TechLab 編輯部(譯)·

由對話整理到重組背景,核對部署方法同 benchmark 邊界

一個 agent 今日改咗 API,聽日開新 session 已經唔記得點解咁改,呢種斷片就係長期 AI 工具最煩嘅位。TechNews 科技新報 形容 EverMemOS 可以幫 AI「工作好幾天」;方向有根據,不過個講法行得快過證據。論文測到嘅係長對話記憶問答,未有 coding agent 無人看管連續跑幾日嘅實驗。

MemCells 收好事件,MemScenes 整理脈絡

一般 RAG 會拆開對話,查詢時搵語意相近嘅 chunks;關鍵字對得上,時間同前因後果仍可能散晒。EverMemOS 論文提出先按話題邊界整理 MemCells。每個 cell 包住事件摘要、可核對嘅 atomic facts、帶有效期嘅 Foresight,同原始時間及來源。Foresight 係模型推斷,可信程度同已發生事實始終有分別。

跟住系統按主題歸類 MemCells,組成 MemScenes,一路更新場景摘要同 user profile,亦會追蹤衝突。答問題時,佢用 dense search 同 BM25 搵候選,再揀相關場景、重排 episodes,剔走過期 Foresight。agentic retrieval 仲會檢查資料夠唔夠,唔夠就改寫查詢再搵。論文話 LoCoMo 有 31% 問題觸發第二輪,準確度背後亦有額外延遲同 token 成本。

對 coding agent 有用,但只補到一截

放落 coding agent,最實際係保存架構取捨、試過但失敗嘅修補、repo 慣例、未完成工作同錯誤原因。下一個 session 可以取回成組背景,少啲重覆解釋。跨日研究都一樣,問題、來源、暫定結論同矛盾證據可以按主題聚埋;日子拉長之後,呢種整理通常好用過純粹放大 context window。

長期記憶只補到狀態連續性。agent 要連續跑幾日,仲要有排程、工具故障復原、權限控制、測試、完成條件同人工 checkpoint;MemCells 冇代你處理呢啲。摘要一旦錯誤咁記低某個決定,後面亦可能沿住錯路行,所以重要決定仍要以 repo、issue 同測試結果做準。

9.2% 升幅有條件,未等於可以放手幾日

研究團隊報告,GPT-4.1-mini 做 backbone 時,EverMemOS 喺 LoCoMo 整體準確率有 93.05%,Zep 係 85.22%;論文寫嘅 9.2% 係相對升幅,絕對差距係 7.83 個百分點。LongMemEval 就係 83.00%,高過 MemOS 嘅 77.80%,相對升 6.7%。多步同時間問題進步幾明顯,MemScenes 呢個方向值得繼續追。

benchmark 邊界亦要講清楚。LoCoMo 只得 10 段長對話、合共 1,540 條問題;LongMemEval 係 500 條問題,仍然係由聊天紀錄搵答案。量化測試預設只用 episodes,Foresight 主要靠質化案例展示;LongMemEval 部分 baseline 直接引用 MemOS leaderboard,冇全部重新跑。OpenReview 暫時只列作 ACL ARR 2026 年 1 月投稿,所以呢批數字暫時只可以當係研究團隊自行報告嘅成績。

EverOS 可以自行部署,整合已經開始成形

論文列出嘅 EverMemOS repo 而家會轉去 EverOS。截至 7 月 15 日,最新 release 係 1.1.1,採 Apache 2.0 license;現版本要 Python 3.12,安裝後可開本機 server。對話、檔案同 agent trajectory 以 Markdown 做主要資料,再同步到 SQLite 同 LanceDB 索引,亦有 add、flush、search 等 API。

模型層支援 OpenAI-compatible endpoint,官方列出 OpenAI、OpenRouter、vLLM、Ollama 同 DeepInfra。repo 亦索引咗 Claude Code plugin 同社群 MCP 方案,後者可接 Cursor、Cline、Gemini CLI 等客戶端。對想跨工具帶住同一份記憶嘅開發者,API 同本機資料層已經夠砌第一版。

資料邊界要畫清楚

local-first 仍要核對資料會去邊官方 quick start預設用 OpenRouter 處理 LLM 同 multimodal、DeepInfra 做 embedding 同 rerank,對話同工作內容可能會送去外部服務。想收窄資料流,可以改用自己管理嘅 vLLM 或 Ollama endpoint;公司部署仲要加身份權限、資料保留期限、刪除同步、磁碟加密同備份規則。user profile 同 Foresight 由多段對話推斷出嚟,敏感程度可以高過原始一句 prompt。

團隊可以先用冇機密嘅 repo 跑幾星期,驗證記憶有冇引用原始來源、舊決定改咗會唔會清走、跨項目會唔會撈亂,同埋模型成本及延遲。呢幾關過到,EverOS 先適合接入長期 coding 或研究任務;「放手幾日」仍要等真正長時間 agent 測試先有答案。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook