什么是LLaDA2.2-flash
LLaDA2.2-flash是InclusionAI开源的扩散语言模型(dLLM),采用MoE架构,总参数量约100B,原生支持128K上下文。模型通过多轮并行去噪拟合答案,引入莱文斯坦编辑实现序列的增删改能力。模型在7项Agent基准上平均得分53.83,逼近同规模自回归模型Ling-2.6-flash的55.74分,同时保持1.64倍解码吞吐优势。
![]()
LLaDA2.2-flash主要功能
- 扩散式并行生成:同时处理多个Token位置,并通过块并行解码实现高吞吐文本生成。
- 莱文斯坦编辑:定长替换的限制由去噪阶段的四种编辑操作突破,分别为KEEP、SUBSTITUTE、DELETE、INSERT。
- 长上下文处理:面向长程软件工程、工具调用轨迹等复杂场景,原生提供的上下文窗口达到128K。
- Agent任务执行:面向需要持续纠错的环境反馈任务,支持代码修复、API交互和多轮工具调用等操作。
- MoE高效推理:长上下文推理成本由块路由机制加以控制,底层使用的是混合专家架构。
LLaDA2.2-flash技术原理
- 扩散语言模型范式:LLaDA2.2并非像自回归模型那样从左到右逐Token生成,而是确定一批噪声位置等待填补,随后反复进行去噪,使完整序列逐渐得到拟合。由于多个位置会协同推进,整个过程具有反复打磨潜力。
- 莱文斯坦编辑机制:四类编辑指令KEEP、SUBSTITUTE、DELETE、INSERT的构建,以最长公共子序列(LCS)对齐目标序列和生成草稿为前提。冗余Token由DELETE移除,后续序列随之左移;[MASK]则由INSERT创建在当前位置之前,留待后续填充。模型因此能够修正非等长序列。
- L-EBPO强化学习:环境奖励由工具调用正确性、输出格式有效性和任务完成度提供,梯度则借助编辑轨迹的恢复覆盖结构决策。算法以莱文斯坦编辑证据下界为依据:内层处理单次生成时Block内的删除和插入,外层完成多轮Agent交互中的轨迹级决策优化。
- 块路由机制(Block Routing):专家工作集可预测的O(C)上界,是通过两阶段路由实现的:每个Token最终在候选池中执行Top-k路由,而候选池由256个路由专家经Token赛马计算Block级准入分数后选出的Top-48构成。这一设计针对的是MoE在长上下文块扩散时出现的专家并集膨胀。
![]()
微信关注后回复开源即可加入AI开源项目交流群
LLaDA2.2-flash使用方法
- 硬件准备:本地部署LLaDA2.2-flash需配备至少4张A100-80GB或同等显存GPU支持BF16全精度加载,若使用FP8量化或处理128K长上下文场景则需相应预留更多显存资源。
- 模型下载:通过ModelScope SDK下载模型时,执行
from modelscope import snapshot_download; model_dir = snapshot_download("inclusionAI/LLaDA2.2-flash")可自动完成约206GB模型文件的下载。 - Git克隆:若采用Git LFS方式获取模型,运行
git lfs install初始化大文件支持,执行git clone https://modelscope.cn/models/inclusionAI/LLaDA2.2-flash.git拉取完整模型仓库。 - 模型加载:调用以下内容,即可由Transformers完成模型加载:
AutoModelForCausalLM.from_pretrained(model_path, trust_remote_code=True, device_map="auto")同时务必设置trust_remote_code=True以启用自定义扩散解码逻辑。 - 精度设置:完成模型加载后,执行
model = model.to(torch.bfloat16)把模型转换至BF16精度,然后调用model.eval()切换为评估推理模式。 - 分词器加载:同时加载对应的分词器
AutoTokenizer.from_pretrained(model_path, trust_remote_code=True),使分词规则与模型配置保持完全匹配。 - 输入构造:构造用户提示后,通过
tokenizer.apply_chat_template([{"role": "user", "content": prompt}], add_generation_prompt=True, tokenize=True, return_tensors="pt")将对话格式化为模型所需的输入张量。 - 参数配置:调用
model.generate()时配置关键扩散解码参数:block_length=32控制每步并行去噪Token数量,threshold=0.5设定去噪置信度阈值,editing_threshold=0.0关闭主动编辑,temperature=0.0启用贪心解码,gen_length=512设定最大生成长度。 - 结果解码:生成结束后,使用
tokenizer.decode(generated_tokens[0], skip_special_tokens=True)最终结果在输出前,需先把Token序列还原成可读文本。
LLaDA2.2-flash核心优势
- 高吞吐解码:与同规模自回归模型Ling-2.6-flash相比,BF16的平均解码吞吐量为其1.64倍;改用FP8量化,还能获得18.6%的额外提升。
- 结构化自我纠错:SWE-bench Verified解决率原为35.8,在模型获得莱文斯坦编辑带来的增删改能力后升至44.4,绝对增加8.6个百分点。
- 原生长上下文:为满足Agent长程交互需求,上下文通过持续预训练由8K增至128K,扩展过程没有使用外推方式。
- 开源可复现:模型及训练细节均已公开,并采用Apache-2.0协议,支持在本地完整复现。
- MoE推理效率:HBM流量及通信成本得以显著下降,是因为块路由机制把每Block的专家工作集约束在固定容量之中。
LLaDA2.2-flash项目地址
- GitHub仓库:https://github.com/inclusionAI/LLaDA2.X
- ModelScope地址:https://modelscope.cn/models/inclusionAI/LLaDA2.2-flash
同类竞品与LLaDA2.2-flash对照
对比维度 | LLaDA2.2-flash | Ling-2.6-flash | 架构范式采用扩散语言模型(dLLM)结合 MoE 架构,通过多轮并行去噪生成序列。采用自回归(AR)结合 MoE 架构,从左到右逐 Token 顺序生成文本。序列编辑能力原生支持莱文斯坦编辑,具备 KEEP、SUBSTITUTE、DELETE、INSERT 四种增删改操作。无原生序列编辑能力,生成后修正需依赖外部重采样或后处理。强化学习策略使用 L-EBPO 算法,在环境反馈中联合优化轨迹级决策与块内编辑动作。采用标准 RLHF 或传统强化学习框架进行对齐与优化。Agent 基准均分在 7 项 Agent 基准测试中平均得分为 53.83。在相同 7 项 Agent 基准测试中平均得分为 55.74,高出 1.91 分。解码吞吐量BF16 平均解码吞吐量达到 Ling-2.6-flash 的 1.64 倍,FP8 量化后再提升 18.6%。作为自回归基准模型,解码吞吐受逐 Token 生成方式限制。上下文窗口通过持续预训练原生支持 128K 上下文,非位置外推方式。上下文能力未在公开技术报告中详细披露具体训练方式。
LLaDA2.2-flash应用场景
- 软件工程Agent:代码修复、Bug定位和函数补全等复杂编程任务往往涉及非等长文本编辑,模型凭借原生支持的莱文斯坦编辑增删改能力能够应对这些任务。
- 多轮工具调用:复杂Agent工作流需要持续纠错时,模型可在MCP协议执行及API交互过程中增删字段、动态修正参数,以完成适配。
- 长文档处理:依托原生128K上下文窗口,模型无需位置外推,即可高效完成长文本分析、报告生成和知识提取。
- 科研与实验复现:LLaDA2.2-flash作为开源MoE扩散语言模型,为学术界提供了自回归路线之外的替代技术路径,以及可复现的研究基座。