}



来源 | 伯虎财经(bohuFN)

作者 |楷楷

一向低调的字节跳动创始人张一鸣,却在近日高调发声。

他在7月底的Seed全员会上罕见现身,明确表示“字节跳动不会把蒸馏当作提升AI模型能力的捷径,即便Seed的模型能力暂时落后于国内主要的竞争对手。”

话音未落,字节又干了一件大事。据36氪报道,其成立了一个新的一级部门“AI数据与安全”,整合超千人的数据团队,与Seed、Flow、抖音等部门平行。

此外,据《晚点LatePost》报道,字节正在讨论训练一个参数规模超5万亿的模型,如果落地,将会是目前国内已知参数规模最大的模型。

同一时间,豆包的商业化也开始全面加速:68、200、500元三档包月正式上线;豆包针对生活服务订单开始抽佣;飞书产品团队与豆包合并,猛攻桌面Agent。

更大的模型、更强的技术基础,以及从架构到业务都重新整合的商业闭环,当字节AI不再强调“追赶”之后,它开始尝试讲一个更慢、但更有想象力的故事。

字节AI,继续“大力出奇迹”,只是这一次,“出力”的方向变了。

01 张一鸣“拒绝蒸馏”

字节跳动创始人张一鸣,自从在2021年退居幕后,一直非常低调。但近日,他却罕见地在Seed全员会上露面,明确表态“拒绝蒸馏”。

随后在8月5日的字节全员会上,字节CEO梁汝波进一步定调:“字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。”

两位大佬同时发声,为何字节会如此态度鲜明地反对“蒸馏”?

先看看何谓“模型蒸馏”?就是用更强大的前沿模型生成的输出,来训练自己的模型。

就像在复习时坐在学霸(教师模型)旁边,向他反复提问,得到答案;再用这些“题目和答案”来训练自己(学生模型),以快速提高成绩。

但需要明确的是,蒸馏不是抄袭,它无法直接获得另一个模型的权重和完整训练数据,它只是一种相对“更快”的学习方式。

在国内AI圈,蒸馏几乎是一种心照不宣的“常规操作”。

比如在2025年初,DeepSeek发布推理大模型DeepSeek-R1,其还同时发布了六个小尺寸的蒸馏模型,它们的“教师模型”都是R1本身。

但在海外AI 圈,蒸馏却引发了舆论风暴。

今年初,美国AI公司Anthropic指控DeepSeek、Kimi和MiniMax三家大模型厂商,对其Claude模型发起工业级“蒸馏”攻击,但这三家企业均未作出正面回应。



蒸馏确实是提升大模型能力的一条“捷径”,但“更快”是不是等于“更好”,则一直留有争议。

主流的观点是,对于第一梯队的大模型企业而言,仅仅通过蒸馏,很难真正建立起技术壁垒。况且,大规模展开蒸馏也是一个比较复杂的系统工程,也需要计算投入回报比。

蒸馏技术本身并非原罪,但至少在字节这里,其对蒸馏的警惕,几乎贯穿了整个AI叙事。

早在2023年,模型团队内部就明确,不得将GPT生成的数据加入训练数据集。

2025年1月,DeepSeekR1横空出世,以有限的训练成本展现出强大的推理能力,给国内大模型企业带来很大的竞争压力,包括字节Seed团队。

对此,Seed内部曾有过讨论,是否要采用蒸馏方式,引入美国头部模型的生成结果,但最终这个提议被管理层否决了。

不过,面对国内外大模型不断跃升的智能水平,蒸馏一直是Seed内部无法回避的选项。

一直到Kimi K3出现,这个同样来自国内的大模型,能力已非常接近国外闭源旗舰模型,让Seed内部偏向蒸馏的声音更多了。

这一次,张一鸣终于站出来表态“不接受蒸馏”。据36氪报道,这次全体会之后,Seed内部出台了新的政策,明确要求禁止蒸馏K3等开放权重模型,并追溯排查疑似蒸馏的行为。

对字节来说,“拒绝蒸馏”不仅仅是口号,还是已经落到实处的动作。

02 打自己最擅长的牌

但问题是,一向信奉“大力出奇迹”的字节,这次为何一反常态,宁愿慢下来?

或许可以回到字节自身的基因里去找答案。

2012年,字节跳动推出第一款产品“今日头条”,从产品模式来看并不算非常创新。当时,搜狐、网易、腾讯等大厂均推出了类似的资讯APP。

但“今日头条”的特别之处在于,它尝试用技术手段来影响哪些内容能被用户看到,依靠算法推荐这一技术,字节走出了一条区别于门户的新闻资讯模式,并沿用至今。

如此,也就不难明白为何张一鸣选择对“蒸馏”说NO。蒸馏本质上是在复制别人已有的能力,沿着这条路走,最多只能不断逼近对方,很难真正实现超越。

只有颠覆行业已有的经验,才能走出属于自己的赛道,这是字节从打造第一款产品就学会的经验,在AI大模型领域更是如此。

2024年,牛津、剑桥等机构的联合研究登上《Nature》封面,指出如果模型反复用AI生成的数据训练,原始数据分布中的尾部信息会逐渐消失,最终产生不可逆的能力退化。

更重要的是,字节的核心战场从来不是纯文本大模型,而是原生多模态,它要求模型从零构建对物理世界的多维度感知,建立文本、图像、视频、音频之间的深层对齐机制。

如果选择蒸馏别人的模型,就相当于继承了别人的编码地基,字节就会失去从零定义多模态模型规则的能力。

那么,拒绝蒸馏的字节,靠什么来让模型变得更强?答案是数据。

近日,字节跳动成立了一个新的一级部门“AI数据与安全”。这个部门的前身之一,是由TikTok创始团队成员傅越成立的数据团队Global Data,同时还整合了多个此前分散的AI数据部门。

据《智能涌现》报道,接近该部门人士表示,这一部门将会是一个横跨基座模型到业务团队的庞大数据团队,其核心职能是为字节所有大模型,提供跨模态的数据服务。

在这之前,字节对大模型的训练数据一直不吝投入。2026年,字节的数据预算已超过千万美元级别,并且是“可以随时追加预算”的状态。

“数据”为什么越来越重要。如今,整个AI行业正在经历一场结构性转变,大模型能力正在快速同质化,算法架构带来的能力提升趋缓,数据逐渐成为决定模型能力上限的变量。

但越是高质量的数据,越是稀缺。据独立研究机构EpochAI 的最新测算,语言模型的训练将在未来五年耗尽人类公开的文本数据,高质量语言数据的枯竭甚至可能提前至2026年。



过去一年,各大模型厂商都加大了对数据的投入。2025年,Anthropic为RL数据拨出了超10亿美元预算;OpenAI全年数据开销约10亿美元,内部预测2030年将涨到80亿美元。

然而,数据恰恰就是字节最擅长的牌。

过去十年,字节已经积累了一套极其成熟的数据飞轮:全球用户每天在平台上产生海量的行为数据,帮助字节绘出更细致的用户图谱,同时不断完善平台的推荐算法。

这些沉淀下来的图文、视频、直播和互动数据,不仅量大,而且真实、带有上下文,也成为了字节大模型最稀缺的训练材料。



在通往AGI的路上,字节已经握着比别人更多一点的底牌。

03 赌一个“不同的未来”

可是,“靠自己”注定会是一条更难的路,甚至会造成暂时落后。

梁汝波也坦承,豆包在C端应用上保持了竞争力,视频生成模型Seedance保持了SOTA,但大语言模型被海外领先模型拉大了差距。

但字节愿意接受这个代价。

因为它在赌一个跟当下其他AI大厂不一样的未来——不是只追求参数和规模的超级大模型;也不是只贩卖模型的技术供应商,而是让AI数据飞轮带动整个生态转动。

字节的目标,在它最近的商业化动作中可以看得清清楚楚。

在C端,豆包开始尝试收费模式。

根据QuestMobile发布的2026年6月AI原生APP月活榜单,豆包以3.82亿月活断层第一,且用户规模还在持续增长,同比增速达172.1%。



用户规模跑起来之后,豆包开始推出专业版会员(68/200/500元三档);同一时间,飞书产品团队已全盘并入豆包,以后一个豆包,就能打通生活和办公两大场景。

在B端,豆包也开始“收税”了。自8月10日起,经豆包入口跳转至抖音来客并成交的部分订单开始执行独立费率,酒店订单的综合费率约12%;部分生活服务类订单约为18%。



还有Seedance,据《晚点LatePost》了解,字节Seedance 2.0视频生成模型当前年化收入(ARR)已达20亿美元(约 143 亿元人民币)。

过去,字节以抖音为流量引擎,嫁接广告与电商;现在,豆包已被列为单独渠道,字节开始为这类由AI带来的交易单独计价。

字节的收费模式只是刚刚开始,比起收多少钱,重要的是其已经打通了以AI助手为入口所带来的一整条交易链路,可以用AI重写本地生活、工作职场两大最高频场景的入口规则。

国内大模型行业的商业化,字节暂时跑在了最前面,核心正是由底座模型、C端和B端所组成的统一战线:

C端豆包在前端“蓄水”,作为统一的落地载体,不断丰富应用场景圈住用户;B端则在中端“开闸”,通过深入本地生活、办公、影视等不同场景,为企业客户提供服务,并收费;

Seed和火山引擎则在底层“筑基”,以模型能力和算力基建托举整个飞轮的持续运转,以上三层打通,字节AI从流量到变现的路就通了。

所以,字节不需要用别人的输出来快速补课AI,它更需要的是用时间去打磨场景、积累数据,像以往孵化APP那样,将大模型当成一个能长出商业模式的实体,服务好用户。

相较于快速拿到好成绩,字节更需要的是时间。

在这场激烈的AI竞争中,每一家大厂都有自己的技术优势和生态能力,字节也有自己的长板——那就是一个更契合的AI生态闭环。

当然,字节赌的这个“未来”,是AI最终会成为下一代的超级入口。

但在AI时代,变化总比想象中来得更快,字节这只“慢龟”,最终能不能更快跑到终点,还要看其他竞争对手如何发力。

文章封面首图及配图,版权归版权所有人所有。若版权者认为其作品不宜供大家浏览或不应无偿使用,请及时联系我们,本平台将立即更正。