0
0
0
0
8 月 6 日,DoNews 援引《The Information》消息,来自字节跳动内部员工爆料,在上个月 Seed 大模型团队的全员大会上,很少参与 Seed 内部会议的张一鸣就 AI 模型发展路线公开发声。
他表示,字节跳动不会将模型蒸馏作为提升模型能力的捷径,即便这会造成公司在现阶段落后于国内同行。
在其他负责人阐述完不采用蒸馏的相关考量之后,张一鸣现场表态:字节应当愿意为更长期的目标,牺牲一部分短期收益。报道没有进一步披露长期目标的具体细节,但释放出明确信号:字节放弃依靠模仿别家模型实现快速跑分提升的路径。
字节也是国内主流 AI 厂商当中,为数不多几乎全部布局专有闭源大模型的企业,和行业多数企业积极拥抱开源模型的发展路线形成明显区别。
这里需要厘清,蒸馏本身属于中性技术。行业普遍会使用自蒸馏,也就是用自家大模型去训练轻量化小模型,用于模型压缩、落地部署;而本次字节内部抵制的,是利用外部第三方模型输出,来训练迭代自身基座大模型的行为,字节还配套 API 检测机制对内部行为加以约束管控。
新模型不需要完全依赖原始训练数据集,可以直接学习成熟先进模型的推理输出逻辑,极大节省训练周期与算力投入,能够快速提升评测榜单表现。但该模式的短板同样明显,模型更多复刻外在输出,很难真正习得底层算法与原始认知能力,容易陷入持续跟跑的局面。
当下国内大模型市场竞争激烈,新模型、新版本密集发布,各家比拼榜单分数、迭代速度成为常态,蒸馏也成为很多团队缩短研发周期的重要方式。海外企业也曾公开对部分国内 AI 企业提出过蒸馏相关的争议指控,而字节并未出现在相关名单之中。
报道提及,部分行业观点猜测该决策或许掺杂海外业务合规层面的考量,但来自字节内部的信息显示,更多来自技术层面的判断:过度依赖外部模型蒸馏,会掩盖自身预训练、数据处理、算法创新的短板,阻碍底层原创技术突破,即便短期拿到好看的评测成绩,长期会限制模型能力天花板。
当然,选择这条路线,代价同样客观存在。消息也提到,不使用蒸馏,被内部视作字节大模型现阶段与国内对手存在差距的原因之一。意味着字节要投入更多算力、数据、人才,完整走完从原始数据到基座模型的全链路研发,需要承受更长研发周期带来的压力。