系列第 4 篇 / 共 5 篇:看不同基础模型到底差在哪里。
先说结论:同一套底层逻辑,不代表能力一样
大模型大多都在做同一件事:用 Transformer 处理上下文,再预测下一个 token。训练路线也相似:预训练学语言和知识,后训练学指令和偏好,对齐阶段让它更符合人类使用习惯。
但同样是这条路线,不同模型的实际体验会差很多。差异主要来自六个地方:架构、训练数据、上下文能力、后训练方法、多模态能力、开放程度和成本。
这就像车都有发动机、轮子和方向盘,但赛车、越野车、家用车的结构和调校完全不同。选模型也不是问“谁最强”,而是问“谁更适合这个任务”。
一、架构差异:Dense 和 MoE
1. 稠密模型 Dense
稠密模型的特点是:每个 token 经过模型时,基本所有参数都会参与计算。
2. 混合专家 MoE
MoE 的全称是 Mixture of Experts,意思是把模型内部拆成很多专家网络。每个 token 进来时,路由器只激活一小部分专家。
可以用一个公司类比:公司有很多员工,但每个项目只叫最适合的几个人参与。这样模型可以拥有很大的总容量,但每次推理只消耗一部分计算。
公开例子里,DeepSeek-V3 是 671B 总参数、每个 token 激活 37B 参数;Qwen3-235B-A22B 是 235B 总参数、22B 激活参数。这说明“总参数”和“激活参数”要分开看。
MoE 的好处是性价比高,适合做大容量模型。代价是路由机制更复杂,部署时总参数仍然要占显存,工程门槛也更高。
二、上下文能力:不是越长越好
上下文窗口决定模型一次能读多少内容。长上下文适合长文档、代码仓库、会议记录、资料整理。
但要注意:标称上下文长度不等于有效理解长度。模型能“装进去”,不代表能稳定记住中间所有细节。实际产品里,长上下文通常还要配合 RAG、摘要、分段检索、引用来源和评估。
所以长上下文没有替代 RAG。RAG 的价值是把最相关的材料提前找出来,让模型在更干净、更短、更可控的上下文里工作。
三、训练数据:读什么,决定擅长什么
模型不是凭空聪明,它的能力来自训练数据和训练方式。
可以这样理解:
这就是为什么不同模型会有不同“性格”。有的擅长写作,有的擅长代码,有的擅长长文档,有的擅长多模态。
四、后训练和对齐:决定模型好不好用
预训练让模型“会说话”,后训练让模型“会听话”。
常见后训练包括:
很多时候,两个模型的基础能力差不多,但一个更会按格式输出、更少废话、更稳定调用工具,体验就会明显更好。这些差异常常来自后训练,而不是单纯参数量。
五、多模态能力:文字、图片、音频、视频不是一回事
多模态模型可以理解或生成文字之外的信息,比如图片、音频、视频。
这里要分清几类能力:
一个模型文字强,不代表图片生成强;能看视频,也不代表能生成高质量视频。做产品时要按任务选专门能力。
六、开放程度和成本:产品里很关键
闭源模型通常生态完整、工具链成熟、综合能力强,但价格、数据边界和可控性要仔细评估。
开放权重模型适合自托管、私有化、可审计、定制部署,也适合在成本敏感的产品里做大量调用。但部署和维护成本会转移到自己身上,包括显卡、推理框架、量化、监控和升级。
独立开发者更现实的方式是模型路由:
七、选型不是选最强,而是选匹配
可以按任务这样判断:
| 任务 | 优先看什么 |
|---|---|
| 中文写作、总结、资料整理 | 中文能力、成本、稳定性 |
| 代码和 Agent | 工具调用、长链路任务、错误恢复 |
| 长文档问答 | 上下文、RAG、引用、评估 |
| 图片理解 | 视觉理解和图表能力 |
| 图片生成 | 构图、中文文字、局部编辑、一致性 |
| 私有化部署 | 开放权重、推理成本、硬件要求 |
八、一句话总结
基础模型的差异,不是“谁参数大谁赢”。
真正要看的是:架构决定计算方式,数据决定擅长领域,后训练决定好不好用,上下文决定能读多长,多模态决定能处理哪些信息,开放程度和成本决定能不能放进产品。
对开发者来说,最成熟的做法不是押宝一家模型,而是按任务建立模型路由和评估体系。
评论
可以留下你的想法。评论提交后会进入审核,通过后公开展示。