首页
看点啥
插画图片
首页 看点啥 怎样破解大模型的“金鱼记忆”难题

怎样破解大模型的“金鱼记忆”难题

2026-07-29 0

从持续理解业务、沉淀经验到交付结果,记忆能力让Agent能够逐步承担这些工作,不再只是“用完即忘”的单点工具,而是进化成智能伙伴。

图片由AI生成

你或许也经历过这样的情况:向客服机器人讲了很久个人信息、诉求与喜好,经过好几轮交流后再次打开对话框,它却礼貌地问候:“请问有什么可以帮到你?”

如果换个模型、换个Agent,再一股脑提交上数十页的文档素材,无论反复输入怎样的提示词,你会发现,AI输出的可能只有开头和结尾的内容,对于中间说了什么,它其实并不记得。

AI虽然聪明,却也非常健忘。这不是错觉,而是当前大模型“无状态交互”的结构性缺陷会使所有历史信息在每次对话结束后全部消失。

这种健忘造成的不只是体验割裂。在企业场景中,为维持上下文连贯,用户必须反复输入历史对话,导致Token消耗长期居高、计算负荷迅速增加,大量资源被浪费在低质量沟通上。

当AI产业逐渐摆脱单纯的参数堆积和算力竞争,一个更本质的问题开始受到业内重视:大模型记忆的关键并非知道得更多,而是怎样有效记住并理解。

这也是红熊AI坚持了两年的答案。

AI越聪明,反而越健忘?

归根结底,记忆与幻觉一样,都是大模型的先天缺陷,并由多项技术限制共同造成。模型固有的上下文窗口上限和注意力衰减,会使长对话早期的关键信息被遗忘;对相似信息辨别不足,以及冲突信息造成的逻辑混乱,则让模型只能作出模糊甚至错误的回答。

作为外 挂记忆产品,早期方案包括RAG检索增强生成与向量数据库——聊天记录的简单存储才是其本质:任务被触发后,文本经检索再投喂模型,记忆无法得到自主管理。因此,真正的长上下文并未实现,更不用说“记住”。

2024年9月,红熊AI在落地AI客服营销场景时发现,客户再次咨询时,AI完全不记得上一次交互。客户每次都得重新解释问题、提交账户信息并交代背景,这严重限制了个性化服务场景的业务准确率。

团队起初尝试了市面上的全部主流方案,包括大模型微调、知识库增强和Agent框架搭建。经过一番探索,准确率仅从30%勉强升至70%。但在红熊AI创始人兼CEO温德亮看来,70分准确率的产品依然远未及格。

那段时期,温德亮带领核心团队查阅大量学术论文,并尝试多种方案,最终意识到:核心问题也许并非模型智能不足,而是记忆缺失。大模型固有的“近因效应”,才构成幻觉和业务断层的根源。或许可以依据“类人脑记忆”来驱动推理,通过记忆约束用户提问的上下文,从而显著提高模型回复准确率。

为使模型回复始终循着记忆推导,团队随后设计动态记忆锚点,把用户的每一次提问都纳入上下文约束。经历多轮尝试后,业务准确率从70%提高到90%,最终在98%以上稳定下来。

这次成功实践彻底改变了红熊AI的创业方向,团队开始专注“记忆”赛道,并在短期内实现净利润;500多家企业客户随后迅速给予认可。近日完成数亿元A+轮融资的消息由红熊AI宣布,其投后估值已达30亿元。

全球两大长期记忆权威评测榜单 LoCoMo、LongMemEval目前均由红熊AI登顶,对应成绩分别为91.54%和95.0%。这意味着其记忆能力既通过产业侧验证,也获得学术界最高认可。

LoCoMo测评结果

LongMenEval测评结果

由单点迈向全栈,将记忆建设为基础设施

“许多企业可能选错了路径。AI记忆机制应在与人的持续互动中形成,而不能只依赖预训练或数据单向输入。”

温德亮认为,AI正在朝“人”的方向继续进化,深入范围还会延伸至脑科学、认知和记忆层面。让AI依照第一性原理,像人一样成长与学习,是这一进程要回答的问题;下一代AI的核心基础设施正在由记忆承担。

该路线的重点,是让记忆机制与大模型底层架构深度融合。技术层面,红熊AI建立了分层记忆体系MemoryBear(记忆熊),参考人类大脑的认知机制,将记忆划分为“瞬时记忆—工作记忆—长期/永久记忆”存储体系;为模拟人类记忆的遗忘和巩固过程,又加入自我反思引擎与智能管理机制。自动遗忘机制+3D反思机制这两大仿生机制也被内置其中,可自主清理过时、错误信息,帮助AI“选择性记忆”,并随着交互时间增加,更准确地识别有效信息。

记忆的完整处理由三步构成:1、萃取:过滤无效冗余内容,并从海量对话交互中提取、筛选高价值情境事实;2、关联:通过知识图谱存储,将不同用户记忆点与不同场景连接成网状关联关系;3、匹配:以混合检索机制匹配当前任务需要的历史记忆,快速、精准地调用关键信息。

在Agent从“问答工具”迈向“可交付结果的智能伙伴”的进程里,核心基础设施正成为记忆的新定位,不再只是边缘能力;红熊AI对业务场景的延伸也验证了这一趋势。红熊AI在产品架构上先从客服场景起步,随后覆盖售前、售中、售后的客服营销,并进一步进入数据分析ChatBI和企业员工培训场景,逐步形成面向智能客服、智能营销、ChatBI、企业培训等场景的Agent应用。客户的真实需求推动了每一次场景延伸。

OpenBear(通用全模态大模型)和CodeBear(记忆型编程大模型)也由红熊AI自行研发。作为AI超级员工入口,前者承担AI操作员角色,与当下的Workbuddy有些相似;后者瞄准工程化开发任务重的核心难题,因为任务中断,或任务项目背景、项目方式发生极大变化时,记忆无法续接都会使工程代码产生偏差。

对红熊AI来说,这两款模型目前虽未必拥有很高的市场预期,却已成为现阶段必须推进的工作。温德亮认为,B端客户并不关心软件企业具体采用哪个模型,更在意核心问题能否解决。以高并发的客服场景为例,业务量激增时,如果上游模型厂商不能及时满足并发请求,软件企业便无法弹性扩容,最终影响下游客户体验,“被迫走向自研,根源在于这种需求长期未能得到满足。”

记忆怎样改变Agent时代的规则

今年以来,业内已多次提到“记忆”并逐步接受其价值,但在更多行业和企业场景里,客户对于如何真正部署记忆并与自身业务结合,依然没有清晰的参考路径。

温德亮表示,客户落地时遇到的挑战十分具体:行业特有的数据Know-how、差异化业务流程和各有重点的客户话术体系,应怎样转化为经验、沉淀为知识,并进一步让模型有效理解;其中还涉及模型迭代稀释原有知识的问题,技术难点不断出现。

同时,许多客户仍按传统软件标准评估AI效果,业务精准度、AI问题解决率和业务转化率等依旧属于传统业务指标。记忆的最终价值仍需体现在实际业务结果上,例如缩短执行时间、提高精准度和改善用户满意度。

企业落地AI时,通常需要整理业务流程、实施数据治理并明确定义交付结果。例如,模型“偏好”的数据往往无法与业务系统实际提供的数据对应,而且企业之间的情况各不相同。

此外,记忆机制虽然可以有效减少Token消耗,却会增加推理时延。在确保准确率的情况下,延迟将从800毫秒升至约1.8秒,这是红熊AI目前可以达到的最优水平。关键是把选择权交给客户:选择响应更快但准确率稍低,或接受稍慢却更精准的结果,都应由客户依据场景自主决定。

温德亮在回答红熊AI的壁垒问题时表示,过去的软件与AI原生软件存在本质差异。硬编码被传统软件采用后,业务逻辑会固化在代码中,因而跨行业复用度不高,基本只能依赖定制开发。由Agent驱动的AI原生应用则无需修改核心业务逻辑和产品适配性,跨行业时调整参数与工作流即可。记忆产品同样依循这种逻辑,使Agent能在合适的时间调用合适的历史信息。

在大洋彼岸,初创公司Engram近期与红熊AI同期获得融资,而它仅依靠“记忆”概念就获得近1亿美元。这两笔融资传递的强烈信号是:AI一旦拥有接近人类的记忆能力,依旧借助上下文窗口或RAG来处理长内容的模型机制,就会遭遇深刻冲击。

企业客户已经用选择表明:模型的机械式死记硬背并非他们所需,以大量Token消耗换来的所谓效率也不被接受。今天,过去常说的降本增效已经不能直接等同于业务价值;Token推理不仅没有边际成本递减,还可能伴随业务增长逐步上升。面对不确定的成本账单,企业不得不精细核算投入产出。真正带来业务价值的关键不只是成本和效率,而是记忆驱动推理所实现的准确性提升。

经过产业的有效验证后,记忆已经成为具备切实商业价值的落地能力,不再停留于技术概念。日常应用也正逐渐迎来由记忆驱动的Agent。

7月31日18:00,红熊AI“记忆觉醒 · 智能新生”线上产品发布会将正式启幕,不仅MemoryBear 记忆引擎迎来重磅升级,还将发布红熊AI自研的OpenBear 、 CodeBear两款记忆型大模型,以及基于原生记忆底座的AI客服、AI营销、ChatBI、AI教育四大场景化Agent应用。

见证记忆怎样重构AI,欢迎观看直播并关注。(作者 | 杨丽,编辑|盖虹达,本文首发于钛媒体APP)

喜欢(0)

上一篇

GPT-6测试时“觉醒”,我们对话测试系统的第一作者

GPT-6测试时“觉醒”,我们对话测试系统的第一作者

下一篇

Claude Code 安装和配置完整指南:兼容国产模型,禁止自动更新

Claude Code 安装和配置完整指南:兼容国产模型,禁止自动更新
猜你喜欢