AI相关论文学习总结 2023年7月[2307.03172] Lost in the Middle: How Language Models Use Long Contexts这篇论文的核心发现是语言模型虽然能接收长上下文但并不能稳定、充分地利用其中任意位置的信息。作者通过多文档问答和键值检索两类需要定位相关信息的任务发现模型的表现会随着相关信息在输入上下文中的位置变化而发生显著波动——当相关信息出现在上下文的开头或结尾时模型表现通常最好而当相关信息被放在长上下文的中间时性能会明显下降。这一“中间迷失”现象即使在专门针对长上下文优化的模型上同样存在。因此论文指出当前语言模型对长上下文的信息利用并不稳健并提出了新的评估协议用于更好地衡量和推动未来长上下文模型的发展。2025年9月 AnthropicEffective context engineering for AI agents \ Anthropic这篇文章提出随着 AI 智能体从单轮提示走向多轮自主循环工程重点正从“怎么写提示”转向“怎么管理上下文”。作者用“注意力预算”比喻 LLM 处理长上下文的固有局限上下文越长模型对任意位置信息的提取和推理能力越会下降即“上下文腐化”现象。因此上下文必须被当作有限且边际收益递减的资源来精心策展。文章给出了上下文工程的核心原则寻找最小但高信号的 token 集合最大化期望行为出现的概率。具体实践包括系统提示清晰、直接避免过度硬编码或过于模糊用 XML 标签或 Markdown 组织内容从最小提示开始根据失败模式逐步添加规则和示例。工具设计工具应自包含、职责清晰、返回 token 高效避免工具集臃肿导致模型选择困难。示例少而精用多样化、典型的示例代替冗长的边界情况清单。动态检索与“即时上下文”不预先加载所有数据而是让智能体通过轻量标识符文件路径、查询等在运行时按需加载信息类似人类使用索引和书签。Claude Code 的混合策略预加载少量核心信息 运行时用grep、glob等工具探索是典型例子。长程任务三大技术压缩Compaction在接近上下文窗口上限时总结关键内容并开启新上下文保留架构决策、未解决问题等丢弃冗余工具输出。结构化笔记Agentic Memory智能体定期将笔记写入上下文之外的文件在需要时读取实现跨上下文的持久记忆如 Claude 玩 Pokémon 时维护训练进度。子代理架构多个专用子代理各自在干净的上下文中完成探索或深度工作只向主代理返回精简摘要实现关注点分离。文章最后强调无论模型能力如何提升把上下文视为珍贵、有限的资源并围绕这一理念持续优化始终是构建可靠、高效智能体的核心。2025年2月10日[2502.06975] Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents该论文提出情景记忆是长期 LLM 智能体所缺失的关键环节主张围绕情景记忆的五个核心属性构建显式的记忆框架以推动能够持续学习和适应动态环境的长期智能体发展2025年7月Agent Memory: How to Build Agents That Learn and Remember | Letta这篇文章系统阐述了智能体记忆的本质是上下文工程——智能体“记住”什么完全取决于其上下文窗口中的 token因此记忆设计的核心是决定哪些信息进入上下文、如何组织以及如何按需检索。文章将智能体记忆分为四类消息缓冲区最近对话、核心记忆固定于上下文窗口的可编辑记忆块、回忆记忆完整对话历史存于外部可按需检索和归档记忆经处理的结构化知识存于外部数据库。技术层面包括消息驱逐与递归摘要以应对上下文限制、记忆块的结构化管理与重写、以及基于向量或图数据库的外部存储与检索。在系统工程上文章介绍了MemGPT的分层记忆架构核心记忆类比 RAM外部存储类比磁盘以及休眠期计算的改进——通过异步专用智能体在空闲时整理记忆避免阻塞主交互并提高记忆质量。文章强调不应简单类比人类记忆而应聚焦于上下文工程设计上下文组织方式、检索工具和提示让智能体能有效利用有限的 token 预算。短期记忆即消息缓冲区中会被驱逐的内容长期记忆则包括其他所有持久化组件。最终构建有效智能体记忆的关键在于组合多种技术动态选择最有价值的 token 放入上下文窗口。