DeepSeek模型蒸馏战:600万美元路径撼动大模型成本

DeepSeek模型蒸馏战:600万美元路径撼动大模型成本

N
News Editor 01
2026-07-23 14:45:15
从Hinton提出“暗知识”到DeepSeek推出多款蒸馏模型,模型蒸馏正改写AI成本结构,也把合法学习与未授权提取的边界推上台面。
DeepSeek模型蒸馏AnthropicOpenAI人工智能

DeepSeek把模型蒸馏推到聚光灯下。按素材所述,这家公司在发布671B参数的R1模型后,又同步推出1.5B到70B不等的7个蒸馏版本,试图用更小的学生模型承接大模型的推理能力。市场关注点不只在性能,也落在成本��素材提到,DeepSeek-R1 API定价为每百万token输入0.55美元、输出2.19美元,而GPT-4o对应价格为2.50美元和10美元

从2015年论文开始,蒸馏的核心是“暗知识”

模型蒸馏并不是新概念。2015年,Geoffrey Hinton、Oriol Vinyals和Jeff Dean发表《Distilling the Knowledge in a Neural Network》,把大模型输出中的概率分布解释为可传递的知识。传统训练更看重“正确答案”,也就是硬标签;蒸馏训练关注的是软标签,即模型除了给出主答案,还保留其他选项的细微概率。

这些接近于零的概率并不多余。它们反映了模型对事物相似性和差异性的理解,也就是文中所说的“暗知识”。学生模型学习的,不只是答案本身,还有答案之间的关系。体积可以小很多,认知框架却能保留相当一部分。

高温训练、低温推理,决定知识能否顺利传递

蒸馏能起作用,还有一个技术点:温度缩放。素材提到,在训练阶段调高温度,softmax输出会更平滑,老师模型给出的软标签信息更丰富;等到部署阶段,再把温度降回去��让学生模型输出更确定的结果。这个机制并不复杂,但很关键。

文章用课堂教学作比喻:老师不只告诉学生答案是A,还会解释A、B、C之间的差异。学生学到的是判断逻辑,而不是死记硬背。这也是蒸馏被广泛采用的原因。素材列举,OpenAI的GPT-4o Mini、Meta的Llama蒸馏版本、Google的Gemini Flash,都延续了这套思路。

DeepSeek把蒸馏从技术路线变成成本竞争

真正引发震动的,是蒸馏带来的性价比。素材称,DeepSeek蒸馏出的7B模型在数学推理基准测试中击败了OpenAI的o1-mini,而DeepSeek-R1-Distill-Qwen-32B在多项基准上超过OpenAI o1。一个更小的学生模型,开始在公开比较中压过更重的对手。

这背后对应的是两套不同的商业逻辑。一种是持续投入更多算力、数据和资金,训练最强的“老师”并通过API出售能力;另一种则是先找到足够强的老师,再把知识尽量压缩到低成本模型中,让部署门槛下降。素材还提到,DeepSeek消息公布后数日内,Nvidia市值蒸发了近6000亿美元,市场开始重新评��“谁掌握最多GPU”的含义。

争议转向边界:蒸馏是学习,还是未授权提取

围绕蒸馏的争议也在升温。素材显示,Anthropic在今年2月公开指控DeepSeek、Moonshot AI和MiniMax,对Claude发起“工业规模的蒸馏攻击”。按其说法,三家公司通过约2.4万个伪造账号,发起了超过1600万次查询,目标是系统性提取Claude的输出。OpenAI也向美国立法者提交公开信,称发现DeepSeek以“混淆方式”蒸馏其模型的迹象。

问题在于,技术动作本身往往相似。AI公司普遍会蒸馏自家模型,做出更轻、更便宜的版本;一旦对象变成竞争对手,争议就出现了。素材指出,目前美国法院仍在审理相关案件,试图厘清模型输出、训练成果与公司财产权之间的边界。在判决出来前,这场围绕知识流动的攻防不会停下。

从素材给出的脉络看,模型蒸馏改变的不只是训练方法。它压低了知识交付成本,也让顶级模型厂商面临同一个问题:当知识可以被持续压缩并扩散时,重金训练“最聪明老师”的回报该如何守住。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。