Qwen3-Max 把 2.4T MoE 开源了,但真正有意思的是 27B
阿里这次一口气甩出两张牌。
一张是 Qwen3-Max,2.4T 参数的 MoE 旗舰,对标 GPT-5、Gemini 2.5 Pro、Claude 4.5 Opus 这种闭源天花板。另一张是 Qwen3-27B 稠密模型,单卡/双卡消费级显卡就能跑起来微调。
两个模型同时瞄准两个场景:Coding(代码生成、Agent 编程)和 Cowork(多 Agent 协作)。
牌摊开了,问题就来了——开发者真正会拿走哪一张?
2.4T 这个数字到底意味着什么
先把最大的误解拆掉:MoE 2.4T 不是 2.4T 都在跑。
MoE(Mixture of Experts)的全量参数是 2.4T,但每次推理只激活其中一小撮 Expert。Qwen 系列的典型激活比在 10% 以内。换句话说,你看到的"2.4T"更像一份能力目录——模型知道很多事情,但回答一个问题时只调用其中一部分。
这个数字真正的意义在于三件事:
- 知识容量上限高。训练阶段压缩进去的模式比稠密模型多。RAG、复杂指令、长链条推理这些吃"见过的题型多"的任务,天然占便宜。
- 对标闭源旗舰的姿态。2.4T 这个量级直接放进开源,国内之前没几家敢这么干。Llama 4 Maverick 也就 400B 激活参数、Llama 4 Behemoth 还是 preview。Qwen 这波把开源上限直接跳了一档。
- 跑起来的门槛没变低。全量部署 2.4T MoE 依然要一堆 H100/H200,显存按 TB 算。一般开发者碰不到,碰到的也是企业级推理服务商。
所以 Max 这张牌,对绝大多数开发者来说是个信号,不是个工具。
27B 才是这波真正的开源炸弹
回头看 27B 稠密模型,这才是开发者今天能上手的那张牌。
几个关键点:
- 单张 RTX 4090 / 5090 就能跑推理,INT4 量化后 24GB 显存就能塞下
- 双卡 A100 / H100 可以微调,LoRA / QLoRA 完全可行
- 稠密架构,没有 Expert 路由那种部署坑,vLLM、SGLang、TensorRT-LLM 现成支持
我自己更在意的是它面向的场景:Coding + Cowork 同时开源。
之前开源模型往往"通用还行、Agent 不行"——能写两段代码,但接到 Claude Code、Cline、Cursor 那种工具调用链上就开始掉链子。Qwen 这波把 Coding(代码生成、工具调用、规划)和 Cowork(多 Agent 协作、角色扮演、任务拆解)一起打出来,本质上是在告诉社区:这两条工作流的开源底座我们包了。
Coding + Cowork 双线押注
为什么是这两条线?因为钱在那里,人也在那里。
Coding Agent 是 2024 年下半年到 2025 年最拥挤的赛道。Anthropic 把 Claude Code 做成产品级体验,Cursor 估值飙到上百亿,Devin、Cline、Codex CLI 一个接一个。底层模型的能力直接决定这些产品能走多远。
Cowork(协作 Agent) 则是 Agent 框架的主战场。LangGraph、CrewAI、AutoGen 这些框架把"多个 Agent 怎么分工、怎么通信、怎么共享状态"抽象成图 / 状态机。底层模型的角色扮演能力、指令遵循能力、长上下文稳定性,决定了这些框架能撑起多复杂的任务。
Qwen 把 Coding 和 Cowork 两个方向的能力同时开源,等于把这两条线的开源底座做实了。对中国团队来说,复现一个 Cursor 或者 CrewAI 级别的东西,模型这一层不再需要重做。
开源拉到 2T 级,中国团队的反应速度
横向看一眼节奏:
- Meta / Llama 系列:Llama 3 开到 405B,Llama 4 Maverick 400B 激活、Behemoth 还在 preview
- Mistral:一直走中小模型路线,Mixtral 系列的 MoE 没破 200B
- DeepSeek:V3 是 671B MoE,这次之前最接近的开源大模型
Qwen 这次 2.4T MoE 直接跳了一档。背后是工程能力和算力储备的双重赌注。
几个值得注意的细节:
- 阿里在 2024 年就铺过 Qwen2.5 系列,开源节奏没断过
- 这次同步放出 Max + 27B,说明团队已经在做"旗舰 + 落地"的产品矩阵化打法
- 时隔数月回归,一次性把上限拉到对标闭源旗舰的位置——这是给国内大模型竞争定调的动作
对中国开发者来说,最直接的影响是:复现前沿 Agent 模型的模型成本被压到了极低。27B 能跑、能微调、能接到任何 Agent 框架里。Coding 工具链的下一波开源产品,大概率会站在 Qwen 27B 上面。
现在能拿它干嘛
如果你今天就想动手,几个立刻能跑的路径:
1. 拉权重,本地部署 27B
# Hugging Face 上拉 Qwen3-27B
pip install transformers accelerate vllm
# 用 vLLM 起服务
vllm serve Qwen/Qwen3-27B-Instruct \
--tensor-parallel-size 2 \
--max-model-len 32768 \
--gpu-memory-utilization 0.9
显存需求参考(FP16):
- 单卡推理:≥ 60GB(A100 80G、H100 80G)
- INT4 量化推理:24GB(4090 / 5090 可冲)
- LoRA 微调:双 80G 起步
- QLoRA 微调:单 24G 可行
2. 接 Coding Agent 框架
Qwen 系列的 tool calling 一直是开源里最稳的之一。直接塞到 Claude Code 风格的 CLI 工具里,或者接到 Cline、Roo Code 这种 IDE 插件里,都不用改太多代码。
# 示例:用 OpenAI 兼容协议调用本地 vLLM
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY"
)
response = client.chat.completions.create(
model="Qwen/Qwen3-27B-Instruct",
messages=[
{"role": "system", "content": "你是一个 Python 工程师"},
{"role": "user", "content": "帮我写一个 FastAPI 接口,读 CSV 返回 JSON"}
],
tools=[
{
"type": "function",
"function": {
"name": "run_shell",
"description": "执行 shell 命令",
"parameters": {
"type": "object",
"properties": {"cmd": {"type": "string"}},
"required": ["cmd"]
}
}
}
]
)
3. 接到 LangGraph / CrewAI
把 base URL 指向本地 vLLM 即可。LangGraph 的 ChatOpenAI 兼容层、CrewAI 的 OpenAI-compatible LLM,都吃这套。
几个要注意的坑:
- 许可证:Qwen 系列多数走 Apache 2.0 或 Qwen 自家 License,商业使用前看清楚细则
- 显存:27B 全精度吃 54GB 左右,量化是必须的;Max 版本基本告别本地
- 工具调用:不同 Qwen 子版本对 tool calling 的支持有差异,部署前先跑一下官方 eval
写在最后
Qwen 这波不是"又发了个大模型"那么简单。
它一次性把三个信号同时打出来:开源上限对标闭源旗舰、落地能力下沉到消费级显卡、Coding 和 Cowork 两个 Agent 战场同时铺底座。
对国内做 Coding Agent、Agent 框架、AI IDE 的团队来说,这是一次"模型层不拖后腿"的机会。剩下的拼的是工程、产品和分发——这些才是更难的事。
来源:Latent Space, Qwen 3 Max: 2.4T MoE + 27B Dense Open Sourced, https://www.latent.space/p/ainews-qwen-38-max24t-and-27b-new