智能与秩序

真正的长期记忆,关键竟然是“遗忘”! Memora 记忆基准

YouTube2026/07/06

摘要

介紹論文 Memora,測試 AI 長期記憶的三種挑戰:記住(Remembering,跨越大量無關對話找回舊資訊)、推理(Reasoning,整合分散事實做運算)、推薦(Recommending,跟上使用者偏好變化)。核心發現:沒有任何系統真正掌握長期記憶;專門記憶 agent 在 Remembering 任務明顯優於裸 LLM,但 Reasoning 任務全員表現很差,Recommending 任務反而是裸 LLM 較佳(因為 LLM 依賴整體印象而非死守單一記憶點)。提出 FAA(該忘的有沒有忘)指標,指出記錯比沒記住更危險。內容為簡體中文頻道轉寫,已正體化與用語校正。

重点

  • 長期記憶的真正挑戰不是記得住上一輪說了什麼,是跨越幾十輪不相關對話後還能不能找回舊資訊、且能不能跟上偏好的變化
  • 三種任務設計:Remembering(跨時間追蹤)、Reasoning(整合多條分散事實做運算)、Recommending(跟上偏好變化而非死守舊記憶)
  • 測試結果:專門記憶 agent 在 Remembering 平均 119.45 分,裸 LLM 只有 65.60 分;但 Reasoning 任務所有系統最高只有 27.55 分
  • 反直覺發現:Recommending 任務裸 LLM(144-153 分)反而優於專門記憶 agent(138 分),因為 LLM 對偏好有整體平滑的印象,而非執著於某條最近更新的記憶
  • 提出 FAA(Forgetting Absence Accuracy)指標:不只看記住了多少有用資訊,也看該忘的過時資訊有沒有被排除;記錯比沒記住更危險,因為系統不會報錯只會悄悄搞砸事情
  • 時間跨度越長所有系統表現越差,季度級別的記憶管理懲罰幅度最大
  • 給 agent 系統開發者的建議:不要把上下文當記憶用(上下文是工作台,記憶要獨立且有結構);重視過時記憶的管理;把推薦當成記憶保鮮度的測試場景

金句

記錯了,你的行為就會基於一個虛假的前提,而系統不會報錯,它只是悄悄地把事情搞砸。
10:15
記憶和推理是兩件不同的事,你記住了一個人的生日,不等於你能算出他下次過生日是什麼時候。
6:59
探索碰撞 ↗

快速浏览

项目动态墙搜索

深度探索

系列知识图谱碰撞
关于联系我
繁简EN日
字号