张一鸣“拒绝蒸馏”引热议:字节跳动坚持长期主义能否突围AI赛道?

   时间:2026-08-07 02:08 来源:快讯作者:苏婉清

在AI大模型领域竞争愈发激烈的当下,技术路线的选择成为行业焦点,其中模型蒸馏技术引发的争议不断升温。近日,字节跳动创始人张一鸣在Seed团队内部会议上的发言,将这一话题再次推到风口浪尖。他明确表示,字节跳动不会依赖AI蒸馏技术改进模型,认为蒸馏会干扰真正意义上的长期技术突破,强调做模型要坚持长期主义,愿意为长期目标牺牲短期收益。

模型蒸馏,即知识蒸馏,是一种模型压缩与知识迁移技术。清华大学基础科学讲席教授刘嘉在《通用人工智能》一书中解释,它如同老师指导学生,利用已训练好的复杂大模型输出的数据,指导更小型、更高效模型训练。其核心是用性能强大的“教师模型”对大量任务生成结果,再用这些结果训练更小的“学生模型”。“学生模型”不仅学习正确答案,还学习“教师模型”对不同答案的判断方式。

然而,这项看似中性的技术工具,却因诸多现实问题成为技术路线争议的焦点。今年初,Anthropic指控多家国内公司通过虚假账户与Claude交互,实施“工业化规模的蒸馏攻击”。不久前,Kimi K3发布时也陷入蒸馏争议,OpenAI战略未来负责人迪恩·鲍尔公开抨击,但月之暗面副总裁黄震昕回应称,K3性能跃升源于底层原创架构创新,并非对现有模型进行蒸馏复刻。

蒸馏技术优势明显。新模型可直接学习现有前沿模型的推理步骤,不必仅依赖原始训练数据,小模型能以极低成本达到接近大型模型的效果,大幅节省算力开销。效率方面,前沿模型公司会通过蒸馏自己的模型,推出成本更低、速度更快的小模型,这是一种行业通行的“自蒸馏”方式。

但蒸馏的代价也不容忽视。过度蒸馏可能导致模型同质化,降低多样性,削弱模型稳健处理复杂或新任务的能力。从技术能力看,学生模型上限受限于教师模型,若整个行业都蒸馏同一个顶尖闭源模型,所有模型将趋同,原创性突破难以实现。蒸馏还存在文化自主性方面的隐蔽代价。刘嘉教授指出,这种省钱、省时的技术路线可能在文化自主性、价值观独特性方面付出长远代价,蒸馏出的国产大模型虽以中文回答问题,却可能继承被蒸馏模型背后的价值体系与意识形态。

刘嘉教授还提出疑问,即使大模型对齐了某种认可的价值观,也会面临动态调整问题。若AI模型频繁调整以匹配主流价值观变化,是否意味着AI只是迎合某种价值观的工具,失去独立性?在更复杂的伦理和社会问题上,如何“公平”进行对齐,始终是充满争议和挑战的伦理问题。

在争议中,字节跳动选择不蒸馏,这一选择在业内引发不同评价。部分观点认为,蒸馏与否是选择问题,无绝对对错;但也有不少用户指出,豆包在复杂推理和代码能力上与头部模型差距明显,“不蒸馏”或许是落后原因。在模型能力被海外SOTA持续拉开差距的当下,用户和市场未必有耐心等待“长期”到来。

今年以来,国内开源模型上新速度加快,能力迭代迅速,给字节跳动带来更大压力。有字节员工表示,Seed团队内部关于是否转向蒸馏的争论由来已久。OpenRouter数据显示,开源模型处理的token占比从2026年1月的34%上升至6月的65%。6月至7月间,智谱GLM - 5.2、Kimi K3、DeepSeek - V4 - Flash正式版等多个大模型密集发布,国产开源模型从代码、全模态、超大规模MoE等多个方向接近全球顶级闭源模型。

面对激烈竞争,字节跳动选择用短期排名落后换取长期技术突破的门票。字节跳动CEO梁汝波在年中全员会上表态,相信AGI、坚持自研是未来字节AI业务的核心方向,接下来大语言模型会坚持自研,做好基本功,接受短期落后,坚持优化长期。火山引擎总裁谭待以视频模型为例,在To B领域,只有SOTA模型才能率先解锁高经济价值的创造场景,Seedance 2.0推动了视频生成技术应用于严肃和商业内容生产场景。对于大语言模型被海外SOTA拉开差距,谭待认为当下最重要的是做好基本功,通过不取巧的方式进入第一梯队。梁汝波补充说,最重要的是动作不要变形,心态上要接受大语言模型一段时间的落后,坚持自研和优化长期。

梁汝波还回应了外部猜测,称坚持自研并非因外部压力,而是希望团队延迟满足感,打好技术基础,这对长期实现AGI很关键。不过,这条路能否走通仍是未知数,在算力成本高昂、开源生态迅猛迭代的当下,字节跳动需承担巨大机会成本。张一鸣的“长期主义”能否被市场和时间验证,取决于其自主研发的底牌能否支撑熬过这场漫长的追赶。

 
 
更多>同类内容
全站最新
热门内容