微信公布 WeLM-80B 与 WeLM-617B 两款稀疏混合专家模型。80B 版本共有 800 亿参数,每次推理激活 30 亿,已用于微信原生 AI 助手小微;617B 版本共有 6170 亿参数,每次激活 230 亿,主要出现在 WeLM 团队的前沿规模模型研究中。小微把模型能力与微信功能、小程序服务连接起来,当前采用小规模原型测试方式提供。
微信把 WeLM 放进了原生 AI 助手小微
腾讯在 2026 年第二季度业绩材料中确认,微信近几周开始小规模测试原生智能体“小微”。小微由定制模型 WeLM 驱动,模型设计围绕用户隐私、微信场景和推理效率展开。
WeLM-80B 是这套产品目前明确使用的模型。它支持小微完成聊天与搜索、调用微信原生功能,以及访问小程序服务。用户不需要离开微信再打开一个独立的 AI 应用,任务可以从对话直接连接到微信已有的功能和服务。
这次开放仍是小规模原型测试。普通用户接触 WeLM 的入口是获得测试资格的小微,而不是单独下载模型。对已经看到小微入口的用户,能够实际使用的是模型与微信功能、小程序服务结合后的完整助手。
两款模型都采用稀疏混合专家架构
WeLM-80B 共有 800 亿参数,但处理一次输入时只激活 30 亿参数。WeLM-617B 的总参数量为 6170 亿,每次激活 230 亿参数。两款模型都属于稀疏混合专家模型,也就是把参数分成多个“专家”,每次只调用其中一部分,而不是让全部参数同时参与计算。
这种设计让总参数规模和单次计算量不再完全绑定。80B 模型可以保留较大的总容量,同时把每次推理实际参与计算的参数控制在 3B;617B 模型同样只激活 23B。对需要嵌入高频应用的 AI 助手,激活参数比总参数更接近一次响应所需的计算规模。
两者的产品位置也不同。80B 版本已经和小微直接关联;617B 版本目前作为 WeLM 团队技术研究中的大规模模型骨干,用于验证更高计算规模下的训练方法。
WeLM 用 Hidden Decoding 增加每个 Token 的内部计算
WeLM 团队还在 80B 和 617B 模型上测试了 Hidden Decoding。这个方法不扩大 Transformer 主体,而是把每个输入 Token 展开为多条并行序列,让同一个 Token 在生成结果前完成更多内部计算。Token 可以理解为模型处理文字时使用的基本单位。
对应的实验模型名为 WeLM-HD4-80B 和 WeLM-HD4-617B,其中 HD4 表示把序列展开为四条流。中间流保留计算结果,最终流负责输出。为了避免多条流之间的注意力计算快速膨胀,模型只在部分层交换各条流的信息,其余层各自处理本流内容。
论文中的对照实验使用相同的早期监督微调方案,没有加入强化学习。这些结果用于验证 Hidden Decoding 对同一模型骨干的影响,与小微当前使用的 WeLM-80B 产品部署是两个不同层面的信息。
对普通用户的变化发生在微信内部
WeLM 这次最直接的用户价值不是多一个模型名称,而是微信开始用自己的定制模型承接原生 AI 助手。聊天、搜索、微信功能和小程序服务被放进同一个任务入口后,用户可以用自然语言提出目标,再由小微连接对应能力。
80B 模型每次激活 30 亿参数,也说明微信在产品落地时优先控制单次推理成本。617B 模型则用于探索更大的能力上限。一个负责当前原型产品,一个承担更大规模的技术验证,两条线共同构成了此次公布的 WeLM 模型范围。


