模型越大,部署越小:AI 云的护城河正在裂开吗?

过去一周,AI 硬件圈同时出现了两个方向相反的数字。 一边是 2.4 万亿参数。Qwen 发布新一代 Max 模型,采用大规模混合专家架构,把模型总参数继续往上推。 另一边是 4.3GB。开源项目 Swiftlet 宣称,可以在普通 Mac 上以大约 4.3GB 内存运行 80B 级 Qwen 混合专家模型,还能把 35B 级模型放进 iPhone。 模型越来越大,运行它的设备看起来却越来越小。 这很容易导向一个兴奋的结论。以后每个人的手机都能装下前沿模型,昂贵的 AI 云和 GPU 集群要失去护城河了。 工程细节给出的答案更有意思。容量、速度和并发是三件事。新方法正在拆掉「模型必须完整塞进显存」这堵墙,同时把成本转移到存储、带宽、延迟和调度上。 云的护城河仍在,形状已经开始变化。 2.4万亿参数,不等于每个字都调用2.4万亿参数 Qwen3.8-Max 公布的总参数规模为 2.4 万亿,采用 MoE,也就是混合专家架构。据发布信息,每次处理 token 时激活的参数约为 95B。 可以把它想成一所拥有大量专科医生的医院。医院的总专家人数很大,一位病人不会同时看遍所有科室。路由系统会为当前问题选择少量专家参与诊断。 MoE 让模型扩大知识容量时,不必让每次推理的计算量按总参数同比增长。代价是所有专家权重仍要存放在某处,路由和通信也会产生开销。训练这样的大模型依旧需要庞大集群,服务大量用户还要同时处理并发、缓存和容错。 Qwen 在 8 月 3 日发布模型时宣布开放权重计划。权重是否已经按承诺完整提供、许可证与部署工具是否到位,需要以实际仓库状态为准。把「宣布将开放」写成「任何人已经可以在家部署」,会跨过一个很大的工程空档。 2.4 万亿这个数字说明开放模型仍在追赶前沿规模。95B 激活参数则提醒我们,模型的总容量和每次回答实际动用的计算量已经分开。 4.3GB内存,靠的是不把80B一直留在内存里 Swiftlet 采用另一种拆分方法。 它是一个基于 Swift 和 Metal 的本地推理运行时,面向 Qwen 的 MoE 模型。系统只让较小的稠密部分常驻内存,再根据路由结果,从 SSD 按需读取当前 token 需要的专家权重。 项目给出的数据是,4 位量化的 Qwen3-Next-80B-A3B 在 Mac 上约占 4.3GB 内存,Qwen3.6-35B-A3B 在 Mac 和 iPhone 上约占 2.5GB 至 2.6GB。 ...

August 8, 2026 · 1 min · 184 words · 钟懿