5万亿参数加禁止蒸馏:张一鸣的长期主义豪赌,字节跳动要造中国最大模型

字节跳动训练5万亿参数大模型,超大型AI数据中心GPU服务器集群

北京,字节跳动总部。深夜的会议室里灯还亮着。

桌上散落着几份标注了”机密”的技术路线图,白板上画满了参数规模对比柱状图。有人在最上方写了一行字,用红色马克笔加粗圈了三遍:5万亿。

这不是电影场景。据多方消息透露,字节跳动正在内部讨论训练一个超过5万亿参数的大语言模型。如果落地,它将超越阿里通义千问的2.4万亿和月之暗面Kimi K3的2.8万亿,成为中国有史以来最大的AI模型。项目由Seed团队负责人项亮牵头,目前处于早期阶段,暂无发布时间表。

但真正引起震动的,不是参数数字本身。

而是张一鸣的一句内部表态。

📖 “禁止蒸馏”:一个创始人的偏执与清醒

据知情人士透露,张一鸣在内部明确表态:拒绝用蒸馏其他模型来刷榜。哪怕暂时落后,也要坚持长期主义。

这句话在AI行业掀起了不小的波澜。要知道,2025年到2026年,”蒸馏”几乎成了中国大模型圈的公开秘密。用GPT-5.6或Claude的输出做训练数据,快速把自家模型拉到接近前者的水平,然后跑分、发榜、喊”超越”——这条捷径,无数团队走过。

短期看,效果立竿见影。排行榜上中国模型扎堆前列,投资人看了高兴,市场声量也上去了。

但代价是什么?

模型的底层能力天花板,被锁死在”老师”的水平上。你可以模仿老师的答案,但学不会老师的思考方式。当真正的复杂推理、长程任务、多步规划这些”硬骨头”出现时,蒸馏模型的脆弱性就暴露无遗。

张一鸣显然看到了这一点。5万亿参数不只是一个数字竞赛,它的潜台词是:字节要用自主训练的底座能力,而不是蒸馏来的二手能力,去争夺AI时代的核心技术话语权。

⚡ 5万亿参数背后:百万级GPU的烧钱游戏

让我们拆解一下5万亿参数到底意味着什么。

先看横向对比。当前中国最大的模型是月之暗面的Kimi K3,参数量2.8万亿。阿里通义千问的最新版本约2.4万亿。字节的目标是直接跳到5万亿以上,几乎是现有最大模型的将近两倍。

再看训练成本。按照目前主流大模型的参数与算力换算关系,5万亿参数的模型,训练阶段至少需要百万级GPU集群持续运行数月。以英伟达H100的单卡价格约3万美元计算,仅GPU采购成本就在30亿美元以上。加上电力、机房、网络、人力,总投入轻松突破50亿美元。

这个数字什么概念?

相当于字节跳动2025年全年净利润的相当一部分。这不是买几台服务器的钱,这是一场all in的豪赌。

但字节有钱。2025年营收超过1500亿美元,现金流充沛。而且字节不缺卡——过去两年,字节是英伟达在中国最大的客户之一,囤积了大量高端GPU。甚至有传闻称,字节在海外通过中间渠道额外采购了大量算力资源。这些”弹药”,正是为5万亿参数模型准备的。

🔮 项亮与Seed团队:字节AI的”特种部队”

项目牵头人项亮,在AI圈内并非家喻户晓,但在推荐系统和机器学习领域是公认的顶尖专家。他曾是中科大教授,在推荐系统、在线学习等领域发表过大量高引用论文。加入字节后,他领导的Seed团队,是字节AI研究的核心力量。

Seed团队的定位很特殊。它不是做基础研究的实验室,也不是直接做产品的工程团队,而是介于两者之间——做能落地的前沿技术研究。从推荐算法到大模型训练,Seed团队的产出贯穿了字节的核心业务线。

把5万亿参数项目交给项亮,信号很明确:字节不打算让这个项目变成纯学术研究,而是要从第一天起就瞄准实际应用。抖音的推荐、豆包的对话、剪映的创作——这些场景都需要更强的底层模型支撑。

时间线也很清晰。2025年下半年,字节开始大规模招聘大模型训练人才;2026年初,豆包大模型多次迭代;2026年8月,5万亿参数项目浮出水面。每一步都在按计划推进。

🌍 全球参数竞赛:不只是中国内部的事

字节的目标,不能只放在中国语境下看。全球范围内,大模型参数竞赛正在进入新阶段。

OpenAI的GPT-5.6系列参数量约3万亿。Anthropic的Claude Fable 5参数量约2.5万亿。谷歌的Gemini Ultra参数量据传在3-4万亿之间。字节的5万亿,如果落地,将直接登顶全球最大模型。

但”最大”不等于”最强”。Hugging Face的报告指出,2026年以来中国模型在参数规模上确实领先美国,但参数规模和实际性能之间的相关性,正在被不断质疑。DeepSeek用相对较小的参数量实现了接近Claude的性能,Qwen3.8-27B仅用270亿参数就超越了自家更大参数的Plus版本——这些案例都在说明同一件事:后训练、数据质量、架构创新,正在比单纯堆参数更重要。

张一鸣禁止蒸馏,某种程度上也是在回应这个趋势。如果不蒸馏,就必须靠自己的数据和训练方法把模型能力提上去。这意味着字节需要在数据质量、训练策略、架构设计上投入远超蒸馏路线的精力。

慢吗?当然慢。

但张一鸣显然认为,值得。

⏳ 时间表与风险:5万亿参数的”未解之谜”

目前这个项目最大的悬念,是时间表。

知情人士透露,项目”目前处于早期阶段,暂无发布时间表”。在AI行业,”早期阶段”意味着模型架构可能还没最终定稿,训练可能还没正式开始,或者刚刚启动预训练阶段。从启动训练到模型发布,5万亿参数规模至少需要6-12个月。

也就是说,即使一切顺利,最早也要到2027年才能看到成果。

这期间的风险不容忽视。训练过程中可能出现loss spike导致训练崩溃,GPU集群可能因散热或供电问题中断,竞争对手可能提前发布同级别模型抢占声量。更关键的是,AI技术迭代速度极快——今天的前沿架构,一年后可能就已经过时。

字节不是没有失败的前例。豆包大模型虽然迭代频繁,但在C端市场的份额远不及预期,被DeepSeek和Kimi甩在身后。字节花重金投入的大模型研发,能否转化为真正的市场竞争力,仍是未知数。

💡 一个时代的注脚

张一鸣的那句”哪怕暂时落后也要坚持长期主义”,放在当下中国AI行业的语境里,显得格外意味深长。

这是一个所有人都急于证明”我最强”的时代。每周都有新模型发布,每月都有”超越GPT”的标题,每个季度都有估值翻倍的公司。在这样喧嚣的环境里,有人愿意为”不蒸馏”这个原则按下暂停键,本身就需要勇气。

5万亿参数的故事,最终可能成功,也可能因为各种原因搁浅。但它传递的信号已经足够清晰:在中国AI产业最热闹的赛道上,至少有人选择了一条更难但更远的路。

张一鸣说过一句话:”延迟满足感,是优秀与平庸的分水岭。”

5万亿参数,或许就是字节对这句话的最新注解。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享