1/ 1
  • 0
  • 0
  • 0
  • 0
张一鸣罕见内部表态:字节拒绝蒸馏捷径

8 月 6 日,DoNews 援引《The Information》消息,来自字节跳动内部员工爆料,在上个月 Seed 大模型团队的全员大会上,很少参与 Seed 内部会议的张一鸣就 AI 模型发展路线公开发声。

他表示,字节跳动不会将模型蒸馏作为提升模型能力的捷径,即便这会造成公司在现阶段落后于国内同行。

在其他负责人阐述完不采用蒸馏的相关考量之后,张一鸣现场表态:字节应当愿意为更长期的目标,牺牲一部分短期收益。报道没有进一步披露长期目标的具体细节,但释放出明确信号:字节放弃依靠模仿别家模型实现快速跑分提升的路径。

字节也是国内主流 AI 厂商当中,为数不多几乎全部布局专有闭源大模型的企业,和行业多数企业积极拥抱开源模型的发展路线形成明显区别。

这里需要厘清,蒸馏本身属于中性技术。行业普遍会使用自蒸馏,也就是用自家大模型去训练轻量化小模型,用于模型压缩、落地部署;而本次字节内部抵制的,是利用外部第三方模型输出,来训练迭代自身基座大模型的行为,字节还配套 API 检测机制对内部行为加以约束管控。

新模型不需要完全依赖原始训练数据集,可以直接学习成熟先进模型的推理输出逻辑,极大节省训练周期与算力投入,能够快速提升评测榜单表现。但该模式的短板同样明显,模型更多复刻外在输出,很难真正习得底层算法与原始认知能力,容易陷入持续跟跑的局面。

当下国内大模型市场竞争激烈,新模型、新版本密集发布,各家比拼榜单分数、迭代速度成为常态,蒸馏也成为很多团队缩短研发周期的重要方式。海外企业也曾公开对部分国内 AI 企业提出过蒸馏相关的争议指控,而字节并未出现在相关名单之中。

报道提及,部分行业观点猜测该决策或许掺杂海外业务合规层面的考量,但来自字节内部的信息显示,更多来自技术层面的判断:过度依赖外部模型蒸馏,会掩盖自身预训练、数据处理、算法创新的短板,阻碍底层原创技术突破,即便短期拿到好看的评测成绩,长期会限制模型能力天花板。

当然,选择这条路线,代价同样客观存在。消息也提到,不使用蒸馏,被内部视作字节大模型现阶段与国内对手存在差距的原因之一。意味着字节要投入更多算力、数据、人才,完整走完从原始数据到基座模型的全链路研发,需要承受更长研发周期带来的压力。

字节此次战略定调,抛出整个行业都在面对的一道选择题:是优先追求快速上线、榜单亮眼的短期成果,还是沉下心打磨原生基础能力,换取远期技术上限。

 

1小时前 安徽

选择要@的好友

  • 😀
  • 😁
  • 😂
  • 😃
  • 😄
  • 😅
  • 😆
  • 😉
  • 😊
  • 😋
  • 😎
  • 😍
  • 😘
  • 😗
  • 😙
  • 😚
  • 😇
  • 😐
  • 😑
  • 😶
  • 😏
  • 😣
  • 😥
  • 😮
  • 😯
  • 😪
  • 😫
  • 😴
  • 😌
  • 😛
  • 😜
  • 😝
  • 😒
  • 😓
  • 😔
  • 😕
  • 😲
  • 😷
  • 😖
  • 😞
  • 😟
  • 😤
  • 😢
  • 😭
  • 😦
  • 😧
  • 😨
  • 😬
  • 😰
  • 😱
  • 😳
  • 😵
  • 😡
  • 😠