长期以来,中国 AI 模型大致可以分成三条路线。 第一条路线是主动往小了做。比如 minimax-m3、kimi k2.5、hy3 这些主动限制激活参数在 20B 上下的模型。关于激活参数 20B 到底算不算小,本身是个很微妙的问题,但工程上我们通常认为它确实小。 更小的激活参数通常都是一个很硬的经济性约束,在经济性约束上做性能最大化,是一种典型的“做小模型”思路。 第二条路线是 DeepSeek,以及 DeepSeek 出现后技术栈类似且尺寸类似的厂商。DeepSeek 路线的特点不仅在于技术完全开源,更重要的是 DeepSeek-V3/R1 在诞生伊始,就是尺寸比较大的模型,对标 Open