腾讯与南洋理工大学:让AI生成的游戏"真正能玩",而不只"好看"
2026-08-08 3444756
2026-08-08 0

这项由国防科技大学领导的研究发表于2026年7月,论文编号为arXiv:2607.27652,有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。
每个人都有过这样的经历:你走进一家陌生的餐厅,服务员递给你一本厚厚的菜单,你翻来翻去,最终挑出了两三道菜,点单之后等待上菜。整个过程清晰、有序——你知道能点什么,不能点什么,每次选择都明确落在菜单的某一行上。
现在换一种场景:同样的餐厅,但这次没有菜单,服务员让你直接用语言描述你想吃什么,然后他去厨房"尽力满足"。你说"我想吃一道有点辣的鱼",他拿来了鱼香肉丝;你再说"不不,我要有鱼的那种",他又拿来了红烧带鱼;你继续说"我想要清淡一点的",他拿来了清蒸鲈鱼……每次你换一种说法,厨房就重新忙碌一次,但最终端上来的菜,其实和第一次差不多。
这个令人哭笑不得的场景,恰恰是当前主流AI搜索系统在工作时面临的真实困境。国防科技大学的研究团队发现了这个问题,并提出了一套名为"Harness-G"的全新框架,彻底重新设计了AI的"点菜方式"。
一、AI搜索的"假性努力"问题
要理解这项研究的价值,需要先弄清楚当前的AI搜索智能体(也就是那种能自主上网查资料、然后回答你问题的AI系统)是怎么工作的。
以Search-R1为代表的一批AI系统,工作方式大致是这样的:给AI一个问题,它会自己想出一个搜索关键词,把结果拿回来看一看,如果觉得信息不够,再想出另一个关键词继续搜,如此往复,直到觉得信息充足为止,最后给出答案。这套流程听起来合情合理,但国防科技大学的团队在实际测量中发现了一个严重的隐患。
研究人员统计了AI系统在训练过程中的行为数据。他们发现,随着训练的推进,AI每次搜索使用的关键词确实在不断变化,表面上看起来"思维活跃、勤于探索"。然而,当研究人员仔细比对这些不同关键词最终检索到的内容时,却发现了一个令人沮丧的规律:尽管关键词的措辞在变,但实际抓取到的证据内容却越来越相似,大量重叠。
用回餐厅的比喻来说:AI不断换着说法点菜,但厨房每次端出来的,基本都是同一道菜的微小变体。这就像你说"辣的鱼"和"有点麻辣口味的鱼类菜肴",两种说法听起来不同,但厨房处理之后,结果几乎没有区别。
研究团队将这种现象命名为"检索等价性崩塌"——用专业语言来说,就是在AI训练约进行到第30个步骤时,不同搜索路径之间产生真正不同结果的比例,已经从训练初期的86%骤降到了不足10%。换句话说,AI的搜索行为看上去多样,实则单调,绝大多数搜索尝试最终走向同一个目的地。
这个问题为什么严重?因为当前主流的AI训练方法叫做"群体相对策略优化"(GRPO),它的工作原理是:让AI对同一个问题生成多个不同版本的回答路径,然后比较哪条路径的最终答案更好,并据此指导AI学习"哪种做法更有效"。这个方法的核心前提是——不同的路径必须真正不同,产生不同的中间结果,这样比较才有意义。
一旦发生检索等价性崩塌,所有路径都走向了同样的证据堆,就相当于你本来想对比"骑车去超市"和"开车去超市"哪种更高效,结果发现两条路最后都堵在同一个路口,两条路的结果完全一样——这时候根本无从比较,训练也就失去了意义。这就是现有AI搜索系统的核心顽疾:表面的多样性掩盖了实质的单调性,学习信号随之消失。
二、解决方案:从"自由描述"到"看菜单点菜"
国防科技大学的团队给出的解决思路,正是本文开头那个餐厅比喻的核心转变:把AI的搜索行为,从"用语言自由描述你想要什么",改成"从菜单上直接挑选你想要的"。
在Harness-G框架下,整个系统的运作方式发生了根本性的改变。研究团队首先在幕后构建了一个"知识图谱"——可以把它理解为餐厅的"厨房台账"。这份台账把整个知识库里的内容拆解成三种基本单元:段落(相当于菜系)、句子(相当于具体菜品)、实体(相当于食材名称)。这三种单元之间有明确的连接关系:哪个句子属于哪个段落、哪个句子提到了哪些实体、哪些实体之间存在关联……整个知识库就这样被整理成了一张清晰可查的网络结构。
这个图谱的构建完全依赖程序化处理,包括句子拆分、命名实体识别(就是识别人名、地名、机构名等)和向量化编码。研究团队特别强调:这个过程完全不需要调用任何大型语言模型,因此构建成本极低——处理一千个词元(大约相当于几篇文章的体量)只需要0.12秒,而且分文不花。相比之下,同类竞争系统Graph-R1为了构建类似的知识图谱,需要花费大约2.81美元的API调用费用,而LightRAG、PathRAG等系统则需要花费高达4美元以上。
在这个知识图谱的基础上,Harness-G设计了一个动态菜单系统。每当AI需要做出检索决策时,系统不是让AI自己发明搜索关键词,而是向AI展示一份当前状态下的"可用选项清单",其中包含三类动作。
第一类是"Select"(选择),相当于"把这道菜加入我的选单"——AI可以把某个当前可见的句子标记为有价值的证据,纳入自己的证据池。第二类是"Lookup"(查找),相当于"我想深入了解这种食材"——AI可以选定某个实体(比如一个人名或地名),系统会自动围绕这个实体检索更多相关内容,展示给AI看。第三类是"Answer"(回答),相当于"我点的菜已经足够了,不再添加"——AI认为已经收集了足够的证据,直接生成最终答案。此外还有一个组合动作"Answer_With",允许AI在选定某个句子的同时立刻终止检索,一步完成"最后一块拼图"的收集与收尾。
这个设计的精妙之处在于:每个动作的目标都是明确的、有限的、可追溯的。AI不是在发明一句话,而是在一个已知的、有边界的选项池里做选择。不同的AI实例面对同一个问题,如果选择了不同的目标实体,那就真的是做出了不同的检索决定,产生了真正不同的证据路径——这才是GRPO训练所需要的"真实多样性"。
研究数据印证了这个直觉:在相同的实验条件下,使用自由关键词搜索的系统,其训练组内的"检索等价类数量"(也就是真正不同的检索路径数量)很快就从平均约2个崩塌到接近1个;而使用菜单选择机制的Harness-G,全程维持在1.5到2.5个之间,始终保留了真实的多样性。这个差异直接决定了训练能否产生有效的学习信号。
三、奖励制度的精细化:不只看结果,还要看"谁功劳最大"
有了更好的"点菜方式",还需要解决另一个经典难题:在一长串的决策链条中,如果最终的菜好吃,功劳应该归给哪一步?
用一个更具体的场景来说明这个问题:假设一个侦探破案,第一天他找到了一个关键目击者,第二天凭借目击者的线索锁定了嫌疑人,第三天审讯嫌疑人获得了供词,最终破案。现在有人要奖励这名侦探,如果只按照"哪一步直接推动了破案"来分配奖励,那第三天的审讯动作可能得到最多的褒奖,而第一天找到目击者的关键行动却可能被忽视——因为找到目击者那一刻,案子并没有立刻有任何进展。
这正是现有AI训练系统的痛点。当AI做出一个"桥接式"的早期检索动作(比如查到了某个人物的名字,为后续的属性查找铺路),但这个动作本身并不能直接提升答案的准确性时,现有的过程奖励机制会给它很低的分数,甚至零分。于是AI就学会了"急功近利"——倾向于直接跳到最后一步的检索动作,忽视那些虽然关键但收益延迟的铺垫步骤。
Harness-G引入了一套叫做"结构化非近视信用"(SNC)的奖励机制来解决这个问题,可以把它理解为一套"溯源归功"系统,由两个部分组成。
第一部分叫"前沿相对优势"。每当AI面对一个信息获取决策时,系统会悄悄预演一下:如果AI选了这个选项,最终答案的正确率能提高多少?如果AI选了其他备选方案,提高多少?然后用一个冻结参数的"答案评分器"(相当于一位不会随训练改变的裁判)来量化这种差异。AI选的那个动作比其他备选方案平均好多少,它就得多少奖励。这样的好处是:奖励不是凭空给出的,而是与同一时刻、同一状态下的竞争选项相比得出的,更加公平和准确。如果菜单上所有选项都差不多,AI就得不到任何特别奖励,不会因为"做了个选择"就白捡分数;只有当AI选出了明显更优的那个选项,它才能获得可观的正向信号。
第二部分叫"溯源激活信用"。系统会记录证据之间的依赖关系:哪个早期动作"生产了"某个实体或句子,而这个实体或句子后来又被另一个动作"消费利用"了。一旦某个下游动作取得了高分,这份荣誉会沿着这条依赖链条反向传播,一直传回到最初做出铺垫的那个动作上。回到侦探的比喻:破案的荣誉不只归给审讯那一步,而是沿着"找到目击者→锁定嫌疑人→获取供词"这条链条,让每一步都分享到适当的功劳,而且越早期的铺垫步骤,越能通过链条积累多个下游成功所带来的复合奖励。
这两个组成部分的奖励都完全来自系统内部的"只读预演",不需要额外运行新的AI推理过程,也不需要什么外部裁判,计算开销极小,只给每个训练步骤增加了大约9%到11%的时间。
四、在六个考场上的表现:多跳问答的强势崛起
Harness-G在六个标准问答数据集上接受了全面检验,这六个数据集分别是2WikiMultiHopQA、HotpotQA、MuSiQue(以上三个属于"多跳问答",也就是需要跨越多篇文章、多个步骤才能找到答案的问题)以及Natural Questions、PopQA、TriviaQA(这三个属于"单跳问答",答案通常在一篇文章里就能找到)。
多跳问答可以理解为"侦探式追踪题":比如"导演了《变形记先生》这部电影的导演是哪年出生的?"要回答这个问题,AI首先得搞清楚这部电影的导演是谁(第一跳),然后再去找这个人的出生日期(第二跳)。两步信息都必须获取,缺一不可。单跳问答则简单得多,类似"法国的首都是哪里?",答案直接就在单一来源里。
在规模较小的1.5B参数版本(可以理解为"小号模型")上,Harness-G的平均F1分数比当时最强的竞争对手Graph-R1高出了整整10.74个百分点。F1分数是一种综合衡量答案准确性的指标,满分为100,提升10分以上在这个领域是相当显著的进步。在规模较大的3B参数版本("大号模型")上,Harness-G的平均F1分数同样超过Graph-R1约3.98个百分点。
更细致地看,多跳问答上的提升幅度格外突出。以3B版本为例,在2WikiMultiHopQA上,Harness-G的F1达到65.53,比Graph-R1的57.56高出约8个点;在HotpotQA上达到65.87,比Graph-R1的56.75高出约9个点;在MuSiQue上达到46.46,比Graph-R1的40.51高出约6个点。这符合直觉:多跳问答正是最需要精确、分步骤的检索决策的场景,而Harness-G恰恰把这个决策过程设计得最为清晰和高效。
与此同时,研究团队还拿Harness-G和一批基于GPT-4o-mini构建的图谱系统(GraphRAG、LightRAG、PathRAG、HippoRAG2、HyperGraphRAG)进行了横向对比。这些系统普遍需要调用昂贵的大型语言模型来提取知识图谱,单次构建就要花费数美元,且效果并不突出。Harness-G在构建成本为零的情况下,性能全面超过这些系统,这一对比更加凸显了其实用价值。
训练过程的稳定性同样令人印象深刻。在六个数据集的训练曲线上,Harness-G的训练批次F1分数持续上升,没有出现主流系统常见的"奖励崩塌"现象(即训练到一半突然大幅下降)。梯度范数(可以理解为训练过程中参数更新力度的大小,过大意味着不稳定)全程被控制在合理范围内,通常低于9。
五、对话效率:步骤多了,但总字数少了
有一个颇为反直觉的现象值得单独说明。研究团队发现,到了训练后期,Harness-G完成一次问答平均需要约3.6轮对话,比Search-R1的2.3轮和Graph-R1的2.8轮都要多。按照直觉,轮次多意味着更"啰嗦"、效率更低。
然而实际上,Harness-G每次对话回合生成的文字量却更少——平均约2500个词元,而Search-R1需要4300个,Graph-R1需要3100个。换句话说,Harness-G每步说的话少而精准,多走几步是因为每一步的动作颗粒度更细、更有针对性;而Search-R1每次输出一大段,看似言简,但质量不稳定。这就好比:一个厨师每次端上一道菜,端了四道,总共八个盘子;另一个厨师每次端上一大托盘,端了两趟,但托盘里装的东西参差不齐,有用的不多。步数多不等于效率低,关键看每一步的信息密度。
六、泛化能力:换个考场也能稳定发挥
研究团队还设计了一套"换考场"测试,即在一个数据集上训练,然后去其他数据集上接受检验,专门考察模型能否把学到的能力迁移到没见过的新场景中。
在30对不同的"训练数据集→测试数据集"组合中,Harness-G赢得了其中21对,平均跨数据集F1分数从Graph-R1的44.10提升到了47.38,提升了3.29个点。特别值得一提的是,在多跳问答类型的目标数据集上,迁移增益平均高达6.45个点;在单跳问答类型上,增益仅约0.12个点。这进一步印证了结构化菜单导航的核心优势在于"多步骤推理"场景,这类场景中的能力更具通用性,可以跨领域迁移。
研究团队还做了一组完全陌生领域的零样本测试,把模型放到医学、农业、计算机科学、法律、混合领域五个专业数据集上,这些领域的训练数据完全没有出现在训练阶段。Harness-G的平均F1分数达到42.30,比Graph-R1的39.14高出约3.16个点,也超过了拥有GPT-4o-mini加持的HyperGraphRAG(38.61)。由于Harness-G的知识图谱是用程序自动构建的,换一个新领域只需要重新跑一遍程序化流程,既不需要标注数据,也不需要额外的语言模型调用,扩展到新领域的边际成本极低。
七、拆解实验:到底是菜单的功劳,还是奖励设计的功劳?
一个自然而然会出现的疑问是:Harness-G性能的提升,究竟主要来自"菜单式选择"这个设计,还是来自SNC奖励机制的改进?研究团队通过系统性的消融实验给出了清晰的答案。
实验的方法是拆分对比:保持其他条件完全相同,只改变一个变量,然后看结果的变化。结果显示,在三个多跳数据集上,仅仅把自由关键词搜索换成菜单式选择,F1分数就提升了超过17个百分点;而在难度最大的MuSiQue上,这个提升超过了35个点。这意味着界面设计本身就贡献了绝大部分的性能提升,即使完全不使用SNC奖励改进,菜单式搜索也已经比自由关键词搜索强出一大截。
然后,在菜单式搜索的基础上,再叠加SNC奖励机制,F1分数在三个多跳数据集上分别又提升了约2到4个点。进一步的细节拆分显示,"前沿相对优势"(比较同状态备选方案)和"溯源激活信用"(让早期桥接步骤获得奖励)这两个子机制,分别拿掉哪个都会导致性能下降,说明两者都有独立的贡献,缺一不可。
研究团队还专门对比了GRPO、PPO、REINFORCE++、DAPO四种不同的训练算法,发现Harness-G在所有四种算法下都能稳定收敛,不存在"只跟某一种算法配合"的局限性。此外,在Qwen2.5-3B、Qwen3.5-4B、Llama-3.2-3B三种不同底层模型上,Harness-G同样保持了稳定的高性能表现,说明这套方法具有良好的通用性,不依赖特定的模型架构。
说到底,Harness-G做的事情,是把AI在搜索和推理过程中一个长期被忽视的问题摆上了台面:搜索的"动作设计"和搜索的"奖励设计"同样重要,甚至前者的影响更为基础。当AI的每一步检索动作都是模糊的自然语言,不同的措辞可以指向同一个结果,那么无论奖励机制设计得多么精细,都在一个先天有缺陷的基础上打转。而Harness-G通过菜单化的方式把这个基础夯实之后,再叠加精细的奖励设计,两者形成了真正的协同效应。
归根结底,这项研究给出了一个相对简单但被长期忽视的洞察:与其让AI学会用更复杂的语言描述它的搜索意图,不如直接告诉它有哪些选择,然后让它从中做决定。这种思路上的转变,换来了成本极低的知识图谱、更稳定的训练过程、更强的跨领域迁移能力,以及在多跳推理题上显著提升的答案准确率。
当然,Harness-G目前仍然是一个纯文本系统,尚不能处理图片、音频等多模态内容。如何把这套结构化导航的思路延伸到多模态场景,是研究团队指出的下一步方向。对于想要深入了解技术细节的读者,可以在arXiv上通过编号2607.27652查阅完整论文,代码也已开源,可供研究人员复现和扩展。
Q&A
Q1:Harness-G框架与Search-R1等传统AI搜索系统相比,核心区别是什么?
A:传统AI搜索系统让AI自由生成自然语言关键词去检索,不同措辞往往检索到高度重叠的内容,导致训练时缺乏有效的对比信号。Harness-G把这个过程改成了"看菜单点菜",AI只能从系统提供的有限选项中选择明确的目标实体或句子,每个选项对应真实不同的检索结果,从根本上消除了"表面多样、实质相同"的问题。
Q2:SNC奖励机制中的"溯源激活信用"是如何解决早期桥接步骤被忽视问题的?
A:传统的过程奖励只看每一步动作能不能直接提升答案准确率,而多跳问题中的早期步骤(如找到关键人物姓名)本身不直接给出答案,所以得分极低。SNC记录了"哪个早期动作生产的信息被后续动作利用了",一旦后续动作取得高分,这个分数会沿着依赖链条反向传播给早期的铺垫动作,让它们获得应得的奖励,从而训练AI学会"先找桥梁、再查属性"的多步推理模式。
Q3:Harness-G构建知识图谱为什么不需要花钱,与GraphRAG等系统差距在哪里?
A:GraphRAG、LightRAG等系统需要调用GPT-4o-mini等大型语言模型来从文本中提取知识三元组和关系标注,每处理一百万词元需要花费2至4美元以上的API费用。Harness-G的图谱构建完全依赖句子拆分、命名实体识别和向量编码这三种程序化工具,完全不调用任何生成式大模型,因此构建成本为零,处理速度也更快,每千词元只需0.12秒。