首页 / 资讯详情
Qwen3.8首日可用,助力存量算力长期有用:智源FlagOS开源开放生态共享
摘要
阿里巴巴开源超大规模Mo E模型Qwen3.8-2.4T-A95B,众智Flag OS社区同步完成Day0多芯片适配。Qwen3.8-2.4T-A95B已在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、隧原等9家AI芯片上完成基于Flag OS统一开源技术栈的多芯适配、精度对齐与部署验证,针对不同芯片情况提供包括BF16FP8INT8等多种精度的版本,开发者可直接获取对应芯片的开箱即用方案。从今年2月首次开展MiniCPM4.5-o模型的多芯片Day0适配,到今天实现Qwen3.8-2.4T模型在9款芯片上的Day0适配,Flag OS已累计完成来自7大头部模型团队、12款主流开源模型、覆盖多达10款芯片的跨芯Day0适配,向AI芯片与大模型产业验证了:基于统一、开放的系统软件栈,实现前沿模型"—次开发、多芯快速适配"已具备规模化落地能力。本次发布的Qwen3.8-2.4T-A95B是阿里巴巴开源模型系列中规模最大、能力最强的一代,首次将Qwen-Max级别的模型开放出来。主要特性:超大规模Mo E架构,总参数2.4T,激活参数95B,纯文本模型编程、专业工作、科研、长程智能体任务能力显著提升;支持reasoning_effort调节推理深度,preserve_thinking保留历史推理原生262,144 tokens,可扩展至1,010,000;提供BF16/FP8权重,兼容vLLM、SGLang、Token Speed在Coding Agent相关基准测试中,Qwen3.8-Max相比Qwen3.7-Max有明显提升:Terminal Bench 2.1从74.5升至86.6,SWE-bench Pro从60.6升至67.7,接近Opus 4.8(69.2),Paper Bench从64.8升至93.0,并超过Opus 4.8(80.3)。本次Qwen3.8-2.4T模型的适配,虽然相比Qwen3.5/Qwen3.6模型主体结构变化有限,但最重要的挑战是模型参数规模比Qwen3.5-397B扩大了6倍。为了让当下已经部署的主流AI芯片能跑起来,Flag OS需要解决因参数规模巨大带来的一系列系统优化问题。为了解决超大规模参数问题,本次Flag OS技术栈新增了面向多款AI芯片的统INT8量化支持,通过Flag OS-Compressor多芯片模型量化工具链,实现了对Qwen3.8的FP8/BF16原生权重到INT8的两条量化压缩路径,并完成量化推理算子的在多款AI芯片的适配。量化迁移后的权重,在多种AI芯片上评测,与英伟达原生基于CUDA的FP8版本对照,误差平均分偏差均在对齐区间内,保证了量化+跨芯迁移后的模型质量。基于众智Flag OS建立的从编译器、算子库、多芯片框架统一plugin等技术,Flag OS团队得以快速完成了模型压缩量化、跨芯适配及验证、精度对齐评测、开源版本发布等重要步骤。—、从Day0适配到规模化验证:打通前沿模型与多元算力的"首日可用"Qwen3.8-2.4T的多芯片Day0适配,是Flag OS紧跟前沿模型发布节奏、实现新模型“首日多芯可用”的又一次实践。自今年2月首次开展Day0适配以来,Flag OS技术团队已在6个月内完成10余款这一能力回应了国产AI算力产业化落地的两项核心需求:一方面,使云服务与应用生态能够第一时间部署最新模型;另一方面,让既有算力基础设施持续承接模型演进,延长使用周期、释放存量算力价值。1、为国产AI算力云服务抢占新模型&qu