2026先导杯落幕:国产千卡智算集群首次实战赋能高校AI
2026-08-17 3452691
2026-08-17 0
2026年8月14日晚,阿里巴巴千问大模型团队正式开源Qwen3.8-27B模型。该模型发布后,昇腾平台同步完成首日适配,依托vLLM-Ascend开源推理引擎,已在Atlas 800 A3与Atlas 850E超节点上实现高效推理部署。

Qwen3.8-27B是一款原生多模态稠密架构大模型,参数规模达270亿。模型原生支持262K tokens的上下文长度,并通过YaRN技术可扩展至最高1M tokens的长上下文处理能力。
在模型结构设计上,Qwen3.8-27B采用混合线性注意力机制:全模型共64层,其中48层使用Gated DeltaNet线性注意力,16层保留标准全注意力机制。该设计有效突破传统长序列场景下O(n²)计算复杂度的瓶颈,在保障建模精度的同时显著提升长文本处理效率。
性能方面,Qwen3.8-27B在编程与办公类任务中全面超越前代Qwen3.6-27B,整体表现亦优于Qwen3.7-Plus。在Agentic terminal coding基准测试中取得73.0分,较前代提升9.6分;在SWE-bench Pro测试中获得61.7分,提升8.2分。模型新增reasoning_effort机制,可根据任务复杂度自适应调整推理深度,在保障效果的前提下优化计算资源消耗。
针对模型特性,昇腾平台实施多项深度优化:Prefill阶段引入GDN融合算子,以Chunk化方式处理超长序列,大幅降低中间数据搬运与算子调度开销;支持W8A8量化部署,将权重与激活值从BF16精度压缩至8位整型,充分释放昇腾NPU在INT8与MXFP8精度下的硬件算力;结合模型原生MTP投机推理能力,由MTP模块预测后续Token并由主模型并行校验,减少主模型调用频次;Decode阶段支持将计算逻辑编译为设备端执行图(ACLGraph),彻底消除重复调度带来的性能损耗。
目前,Qwen3.8-27B已在Hugging Face及魔搭社区(ModelScope)同步开放下载。昇腾平台同步提供完整部署指南,用户可通过vLLM-Ascend开源推理引擎快速完成本地化推理部署。