独家解读丨字节 Seed 大调整,分支背后谁在操盘?
大模型竞争开始拼组织,这一次轮到字节。 8 月 19 日,据晚点 Late Post 报道,Seed 基础模型团队新设 Pretrain Data(预训练数据)、Horizon RL(强化学习)、Product Posttrain-Work(面向办公场景的产品后训练)和 Product Posttrain-Chat(面向对话场景的产品后训练)四个一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳等人负责,均向吴永辉汇报。 雷峰网了解到,四个新部门之下的分支架构与带队人选也已落定,而这些更细的调整,或许更能透露出此次组织变动背后的真实意图。 01 数据和RL开始集中 先看模型能力侧的两个部门。 有接近字节的人士称,Pretrain Data 由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而来,下设文本预训练(沈科)、代码预训练(Xia Xiao)、视觉预训练(林毅)和语音预训练四个分支,统一为 Omni 全模态模型和超大模型供给数据; 负责人李成刚是清华机械系本硕,曾从 0 到 1 搭建字节搜索系统,先后负责今日头条网页搜索和 TikTok 视频搜索的技术工作,其麾下沈科 2018 年从清华毕业后加入字节,是超大模型预训练数据的核心人物,Xia Xiao 则是开源代码模型 Seed-Coder 和定理证明搜索方法 BFS-prover 的核心作者之一。 相比数据条线,Horizon RL 的动作更大。Horizon RL 整合了分散在推理、视觉理解等方向的后训练团队, 下设 RL Scaling(岳宇)、Reasoning(王明轩)和视觉强化学习(吴侑彬)三个分支,负责强化学习、提升模型的基础智能上限。 其中王明轩此前在火山翻译,北航本科、中科院计算所博士,曾在腾讯任高级研究员、多次拿下 WMT 机器翻译评测冠军,2019 年加入字节后一路做到大模型研究团队负责人,岳宇(Yu Yue)则是字节与清华 AIR 联合开源的强化学习系统 DAPO 的算法作者之一。 这条路线其实已经有技术积累。Seed 此前公开过 DAPO、VAPO 等强化学习工作,其中 VAPO 聚焦于推理模型的强化学习效率与稳定性;Seed 也持续把RL用于更长链路的推理和Agent能力。 把这几个人和三个方向放在一起,Horizon RL 的意图就比较清楚了。 它并不是简单把原来的“后训练团队”换了一个名字,而是在把 Reasoning、VLM 等不同方向中的 RL 能力进一步集中。 据晚点 LatePost 报道,Seed 在调整公告中称,此次调整旨在‘合并相似工作、减少 overlap,内聚在一起’。 上述人士告诉雷峰网,本轮调整后,文本、代码、视觉这些老方向也没有真的消失,只是换了一种管法。 以视觉为例:训练前的数据归 Pretrain Data 的林毅,训练后的强化学习归
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。