Qwen 3.8 Flash-Next的问世在开源模型领域引起了一阵轰动。该模型仅使用了6B激活参数,却在与Claude Opus 4.6 Max的9项基准测试中拿下8项胜利。这个消息源于社交平台用户Chubby♨️的动态,Qwen的官方账号随后也验证了这一成果。分析数据,这一成果生动地展示了“小参数、大能力”的理念——凭借极低的推理资源,取得了与旗舰模型相媲美的表现。Qwen 3.8 Flash-Next的架构设计非常前卫,总参数高达125B,但每次推理时只需激活6B的参数,这一设计大幅降低了计算需求,相比同类稠密模型,推理成本和响应时间均得以显著降低。这种高效的设计在需要快速反应的应用场景中具有极大的价值。
除了采用稀疏的架构,Qwen 3.8 Flash-Next还提供了原生支持256K的上下文长度,借助YaRN技术还可以扩展到1M。这使其在处理超长文本、代码库或复杂对话历史时表现得尤为出色,成为一大优势。它的具体基准成绩如下:在 SWE-bench Pro 中得分62.5,明显高于Claude Opus 4.6 Max的53.4,此外在编程能力和日常办公任务上,Qwen 3.8 Flash-Next的表现也超越了前一版本Qwen 3.7-Plus,而训练成本则仅为后者的1/9。
在处理1M上下文时,虽然长文本通常意味着性能下降,Qwen团队通过优化实现了显著提升。官方数据显示,在这一背景下,注意力内核的预填充速度提高了7.6倍,解码速度提升了4.9倍,这样即使面对超长文本,模型依然能够维持良好的响应速度。此外,这款新模型在绝大多数基准测试中也优于Qwen 3.8-27B和DeepSeek-V4-Flash,彰显了开源模型竞争的激烈程度。
Qwen 3.8 Flash-Next的发布明确表明,大模型之间的竞争重心已逐步由“参数数量”转向“效率”。通过6B激活参数实现接近并超过顶级闭源模型的指标,这无疑降低了推理的成本和部署的门槛。对于开发者而言,这意味着更低的硬件门槛、更快的响应时间,以及更可控的运营支出,开源社区又获得了一个值得认真考虑的选项。
当然,基准测试的得分只是评估的一个方面,如何在实际业务场景中表现还需进一步验证。但从现有的数据来看,Qwen 3.8 Flash-Next确实交出了令人惊喜的成绩单。