北京
DongfangScience 科学,为了更美好的明天
智能

阿里巴巴发布2.4万亿参数Qwen3.8-Max并开放权重

这是Qwen团队Max级模型首次开放下载,同时发布的还有面向本地部署的较小型号Qwen3.8-27B。

位于杭州的阿里巴巴集团西溪园区
位于杭州的阿里巴巴集团西溪园区 图片: Danielinblue, CC BY-SA 4.0 来自维基共享资源

阿里巴巴发布了其Qwen系列中规模最大的模型Qwen3.8-Max,并履行了公开权重的承诺。据SiliconANGLE和The Batch报道,该模型于8月初发布,采用混合专家架构,总参数量达2.4万亿,每个token激活950亿参数。

这是首款开放权重的Max级Qwen模型。阿里巴巴此前从未公开过Max级模型的权重。公司在发布时便在其云平台上提供Qwen3.8-Max,并表示权重将于下周与Qwen3.8-27B一同发布,后者是一款面向配置较低硬件的小型模型。The Decoder报道称,相关权重将托管于Hugging Face和魔搭社区。

通过阿里云API提供的版本可接受文本、图像和视频输入,上下文窗口最高达100万token,输出可达13.1万token。而可供下载的模型版本,即Hugging Face上列出的Qwen3.8-2.4T-A95B,功能更为有限。其模型卡显示,该模型仅支持文本,原生上下文长度为262144 token,可扩展至约100万token,共有92层,混合了Gated DeltaNet和Gated Attention组件,并包含512个专家模块。

两个开放版本的授权方式有所不同。大模型采用定制的Qwen3.8-Max许可证,The Batch报道称,该许可证为最大规模的商业用户设定了额外条件;而Qwen3.8-27B则采用较为宽松的Apache 2.0许可证。

阿里巴巴将该模型定位于长周期任务,即无需人工介入、可运行多个步骤的任务。SiliconANGLE报道称,阿里巴巴表示Qwen3.8-Max曾自主完成一项长达16天的编程项目,并完成了一项超过500步的芯片设计优化任务。SiliconANGLE还报道称,在Frontend Code Arena排行榜上,该模型得分1668分,落后于Anthropic Claude Opus 5最高配置37分。

此次发布公布的许多其他基准测试结果均来自阿里巴巴的内部测试。The Decoder指出,与模型开发商公布的分数一贯的情况相同,在公告发布时独立验证仍未完成。

据The Batch报道,通过阿里云API使用该模型,价格为每百万输入token 2.00美元,每百万输出token 6.00美元。这一规模的开放权重主要面向云服务商和大型研究机构,因为运行一个2.4万亿参数的模型需要相当可观的硬件资源。

来源

  1. SiliconANGLEsiliconangle.com
  2. The Batch (DeepLearning.AI)deeplearning.ai
  3. The Decoderthe-decoder.com
  4. Hugging Face: Qwen/Qwen3.8-2.4T-A95Bhuggingface.co

更多: 智能AI & Robotics

更多