EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory作者Chang Nie, Chaoyou Fu, Junlan Feng, Caifeng Shan核心发表机构Nanjing University论文链接arXiv:2606.21649v2发布于arXiv 预印本cs.CL|—|—|—|—|| 表示是否演化 | 否孤立编码 | 否依赖外部流程 | 记忆演化但与生成耦合 | 是记忆 内容联合生成 || 训练目标 | 对比学习短静态样本 | 通常无统一表示训练 | 语言建模为主 | 记忆生成损失 长度加权对比损失联合 || 部署约束 | 无 | 需索引、改写、重排等多模块 | 需要白盒访问内部隐状态 | 多 LoRA 解耦推理仅执行表示生成 || 长上下文效率 | 分段独立编码无全局上下文 | 高延迟、复杂管道 | 线性复杂度与生成耦合 | 分段批处理 固定容量记忆队列 || 对话/时序检索 | 易检索到过期信息 | 通过任务编排弥补 | 尚不明确 | 时间关键词下相似度峰值清晰 |六、局限性与展望 / Limitations Future Work论文与源码笔记中报告的局限性主要集中在三个方面。第一是域外泛化受限。受限于计算资源与训练数据规模EvoEmbedding 在训练分布之外的场景中可能出现性能下降。EvoTrain-180K 虽然覆盖了网络文本、对话与记忆片段三类上下文但本质上仍是合成数据其多样性无法与大规模互联网预训练语料相比。训练数据的模板多样性40 类型与领域覆盖面仍然有限在高度专业化的下游领域如医疗、法律、代码检索中模型的表现需要进一步验证。第二是不支持多模态检索。当前实现只处理文本输入。虽然架构在原则上可以扩展到视觉或音频模态只需引入对应的编码器与投影器但全模态的长时记忆管理需要更大的队列容量与更复杂的跨模态维度对齐。潜在记忆队列的容量C 512 C512C512是当前配置下的经验最优值在多模态场景下记忆的语义密度和信息压缩方式都会发生根本变化需要重新设计。第三是顺序编码的效率瓶颈。EvoEmbedding 必须顺序处理输入以维持状态依赖这导致了上下文编码时间显著长于静态嵌入模型22.08s vs 3.80s在 LongMemEval 上。虽然分段批处理技术通过并行处理多个连续片段缓解了这一问题但本质上顺序编码的复杂度无法通过简单的硬件扩展来完全解决。论文采用固定容量记忆队列将计算复杂度限定在可控范围内但这也意味着模型无法同时利用所有历史信息——它只能通过C CC个潜在 token 的固定宽度瓶颈来压缩历史。对于需要精确回忆远古细节的场景这种有损压缩可能成为瓶颈。第四是对记忆容量的敏感性。消融结果显示当C CC超过 512 后性能趋于饱和但这可能只是当前训练分布最大 10,270 token下的现象。在更长上下文如百万级 token中固定容量队列是否足以承载关键信息以及如何自适应地调整记忆容量与更新策略都是开放问题。未来工作的可能方向包括扩展训练数据规模与多样性以提升域外泛化引入多模态编码器以支持跨模态检索与记忆探索更高效的顺序编码架构如状态空间模型或线性注意力机制来降低编码延迟设计自适应记忆容量机制使模型能够根据任务复杂度动态调整历史信息的保留粒度。七、总结 / ConclusionEvoEmbedding 提出了一种全新且简洁的范式通过在顺序编码过程中持续维护一个固定容量的潜在记忆队列将文本表示从静态的、上下文无关的向量转变为动态的、随历史状态演化的可演化表示。论文的核心洞察在于长上下文检索的真正难点不在于如何把更长的文本塞进一次前向传播中而在于如何在表示层面显式建模事件的时间顺序与状态演变。围绕这一洞察论文做出了三项关键贡献。在方法层面通过记忆演化与表示生成的双任务解耦设计配合多 LoRA 适配器实现了记忆能力与检索能力的隔离与协同通过 FIFO 记忆队列从机制上消除了循环编码中的表示坍缩问题使模型无需课程学习即可直接在长上下文上端到端训练通过动态分段批处理在解决长度方差问题的同时实现了 3.8× 的训练加速。在数据层面EvoTrain-180K 以三阶段自动合成管道生成了高质量的长上下文训练数据混合长度设计与动态状态转换的标注策略使得模型能够在远小于测试场景的训练窗口上学会长程时序追踪。在实验层面EvoEmbedding-2B/4B 在 8 个长上下文检索基准上的 Recall10 全面超越 Qwen3-Embedding-8B 与 KaLM-Embedding-Gemma3-12B 等更大规模的专业模型模型仅利用 180K 合成样本与标准 SFT 训练便取得了超过依赖 100M 数据与多阶段训练的竞争者的成绩充分证明了架构设计相对于数据规模的杠杆效应。更值得注意的是EvoEmbedding 可以无缝集成到 agentic 工作流中仅用朴素 RAG 管道即可超越 A-MEM、LightMem 等专用记忆系统将其嵌入现有 agentic memory 框架还能进一步带来 13.5% 至 20.5% 的性能提升。EvoEmbedding 的价值不仅在于性能数字本身更在于它揭示了长上下文表示学习的一条可行路径与其试图无限扩展上下文窗口不如让模型学会在有限记忆中高效地组织、更新与查询历史状态。这种“记忆即表示”的设计哲学为长上下文信息处理与智能体记忆的未来研究开辟了新的方向。原文摘要:Existing embedding models are inherently static: they encode text segments in isolation, ignoring their surrounding context and temporal order. This paper introduces EvoEmbedding, a novel embedding model that generates evolvable representations for retrieval. It is tailored for long-context scenarios, where information is dynamic, sequential, and requires continuous state tracking. Our design is simple: EvoEmbedding maintains a continuously updated latent memory as it sequentially processes inputs, and uses it alongside the raw content to jointly generate evolvable embeddings. Consequently, for the same query, our model adapts its representation to retrieve distinct targets based on the evolving context, going beyond static semantic search. To equip the model with this capability, we construct EvoTrain-180K, a diverse dataset for the joint optimization of latent memory and retrieval. Furthermore, we introduce a memory queue to prevent representation collapse during recurrent encoding, alongside segment-batching techniques that tackle significant length variance and accelerate training by 3.8× \times×. Extensive experiments show that our model not only outperforms larger-scale specialists (e.g., Qwen3-Embedding-8B and KaLM-Embedding-Gemma3-12B) across a range of long-context retrieval benchmarks, but also generalizes well to downstream tasks (e.g., personalization) with contexts 10× \times×longer than its training window. Notably, EvoEmbedding seamlessly integrates into agentic workflows to boost performance. For instance, a naive RAG pipeline equipped with our model surpasses dedicated agentic memory systems. Project Page: https://clare-nie.github.io/EvoEmbedding/.PDF链接:https://arxiv.org/pdf/2606.21649v2部分平台可能图片显示异常请以我的博客内容为准