在AI创业的浪潮中,大模型军备竞赛从未停歇。近日,字节跳动被曝正在讨论训练一个参数规模超过5万亿的巨型模型,这意味着其参数规模将是阿里Qwen 3.8-Max(2.4万亿)的两倍多,也远超月之暗面K3(2.8万亿)。这一消息迅速震动业界,它不仅代表着国内AI基础设施的又一次跃迁,更折射出头部玩家在技术路线、人才与战略上的深层博弈。对于投身AI创业的团队而言,这场豪赌的胜负手,可能重新定义未来几年的竞争水位。
5万亿参数:一场豪赌背后的技术野心
大模型的能力与参数规模之间并非线性关系,但业界普遍认为:在一定范围内,参数越大,模型在复杂推理、多模态理解与长文本生成上的表现越强。字节跳动此次讨论的5万亿参数模型,如果最终落地,将成为国内已知参数规模最大的AI模型,甚至可能在全球范围内跻身第一梯队。
然而,训练如此庞大的模型并非易事。参数规模翻倍的同时,需要处理的训练数据量、计算资源消耗、并行策略复杂度都会呈现指数级增长。据知情人士透露,字节内部多位Seed团队成员在上半年已开始“不断反思”,正是这种反思促使团队决定将参数规模一次推到同行的数倍。这种“一步到位”的策略被一些内部人士形容为“像一场赌博”——一旦成功,字节将在智能水平上建立显著领先优势;但若失败,巨额投入可能面临沉没风险。
值得注意的是,该计划仍处于早期讨论阶段,具体训练成本、时间表以及是否最终执行尚未确定。但字节的举动已经向市场释放了一个明确信号:在AI赛道,它不满足于跟随,而是试图通过大模型训练的极致规模来获取不对称优势。这一趋势也提醒着所有AI从业者,科技产品的竞争正从应用层向底层基座模型加速迁移。
核心团队:搜广推基因如何赋能AI尖兵
任何技术突破都离不开关键人物。消息称,该5万亿参数模型将由Seed Foundation负责人项亮主导,大语言模型预训练数据负责人沈科配合。两人均是字节跳动AI体系内的核心骨干,且都出自字节的“搜广推”体系——搜索、广告、推荐。
项亮本科毕业于中国科学技术大学,博士就读于中国科学院自动化研究所,2016年加入字节后曾负责机器学习中台AML团队,后调任豆包大模型Foundation团队负责人。沈科2018年从清华大学毕业后直接加入字节,现主要负责LLM预训练数据。两人的背景折射出字节在AI人才上的独特路径:并非单纯依赖学术大牛,而是从内部工程与业务场景中选拔出最懂数据与算力的实战派。
之所以强调“搜广推基因”,是因为推荐系统本质上就是大规模参数化模型在实时场景下的极致应用。字节在推荐算法上的积累(比如抖音的流量分发)使其团队对稀疏数据、在线学习、分布式训练有着深刻理解。这些经验迁移到大模型训练中,能帮助解决超大规模模型在稳定性、收敛速度与成本控制上的痛点。实际上,字节的豆包大模型已经展现出较强的多轮对话与任务执行能力,而这背后正是搜广推团队对“海量用户行为数据”的驾驭能力。
对于AI创业团队而言,字节的案例揭示了AI工具导航中的一个关键洞察:技术底座并不只是学术论文的堆砌,而是工程经验与数据飞轮的融合。想要在AI浪潮中突围,或许可以从AI工具箱中找到适合自己的轻量级方案,但若想追平头部玩家,底层数据工程能力不可或缺。
张一鸣的“反蒸馏”哲学:追求智能上限而非短期复制
在两周前的Seed全员会上,字节跳动创始人张一鸣亲自出面安抚团队。他坦言训练大模型本就是一件很难的事,团队不必过度焦虑,并明确表示“一段时间内可接受模型落后于行业”,希望大家以追求智能上限为目标,期待Seed模型能力能跻身世界第一梯队。
更引人注目的是,张一鸣在会议上明确表态反对蒸馏(distillation)。他认为蒸馏虽然在短期内能改善模型表现,但本质上是在复制Claude(或其他领先模型)已有的能力。“沿着这条路走,最多只能不断逼近对方,很难真正实现超越。”这番话道出了他对创新路径的深层思考:与其做跟随者,不如在基础架构和训练方法上寻求突破。
蒸馏技术是当前许多AI公司快速提升模型能力的常用手段——通过让大模型学习教师模型的输出,可以低成本获得接近教师模型的效果。但张一鸣的反对立场,意味着字节愿意承受短期内的落后,以换取长期真正的技术代差。这一决策极富魄力,也间接解释了为什么字节敢于讨论5万亿参数这样“激进”的目标。
当然,反对蒸馏不等于放弃所有成熟技术。字节的模型仍会参考大量开源成果,但更注重在训练数据质量、强化学习对齐、多模态融合等方向上的原创投入。对于AI创业者来说,张一鸣的表态提供了另一种思路:在最新科技的竞赛中,有时候“慢下来”找对方向,比盲目堆量更有效。正如AI画图领域,许多团队通过精调LoRA或ControlNet就能做出差异化产品,但真正的领先者往往在底层扩散模型上持续迭代。
字节的AI生态:从豆包到千亿参数,下一步是什么?
字节跳动在AI领域的布局并非一夜之间。从早期的飞书智能助手,到2023年推出的豆包大模型,再到如今讨论的超5万亿参数模型,其AI战略呈现出明显的“渐进式跃进”特征。豆包已经积累了数千万用户,在C端对话、文本生成、代码辅助等场景中表现不俗。但字节显然不满足于此,他们希望用更大规模的模型来支撑更复杂的应用,比如多模态视频理解、虚拟世界生成、甚至下一代AI Agent。
值得注意的是,字节的AI布局并非孤立。在应用层,它拥有抖音、今日头条、TikTok等海量用户场景,数据反馈闭环非常完善。在基础设施层,它自建了大规模GPU集群,并在云计算、边缘计算上持续投入。这种“模型+场景+算力”三位一体的能力,使得字节在训练超大规模模型时具备天然优势——不同于很多AI创业公司需要四处采购算力,字节可以内部调度资源,降低边际成本。
此外,字节还在探索AI与内容创作、广告营销的深度融合。例如,利用文生图技术自动生成广告素材,或是通过AI图片生成为电商卖家提供定制化产品图。这些应用场景的落地,反过来又为大模型提供了更丰富的训练数据,形成正向循环。可以预见,一旦5万亿参数模型训练成功,字节在AI驱动的商业变现上将拥有更强的护城河。
对AI创业者的启示:规模竞赛下的生存法则
字节跳动的5万亿参数模型计划,对于AI创业生态意味着什么?首先,这可能会加剧人才和算力的争夺。超大规模模型需要顶尖的算法工程师和大量的GPU资源,而这些资源本就稀缺。头部玩家的扩张,可能推高整个行业的成本,让中小AI创业公司面临更大的压力。
但另一方面,大模型能力的提升也会惠及生态。更强的基座模型意味着API调用效果更好,AI创业公司可以基于更优秀的模型开发上层应用,而无需从零训练。例如,创业者可以利用艺术签名或AI网名等轻量级工具切入细分市场,快速验证商业模式。关键在于找到大模型难以覆盖的垂直场景,或者通过数据飞轮建立自己的竞争优势。
张一鸣的“反蒸馏”哲学也给创业者提供了启示:与其盲目模仿头部产品,不如在特定领域深耕。比如,在教育、医疗、法律等专业领域,如果能构建高质量的行业数据集和评估体系,即使使用中等规模的模型,也能做出有壁垒的产品。此外,创业者还可以关注抠图、背景去除等图像处理工具,这些领域虽然看似拥挤,但结合大模型的理解能力,仍有创新空间。
最后,字节的举措也提醒大家:AI创业不仅要关注技术本身,更要关注资本与战略的耐心。张一鸣愿意接受模型短期落后,是为长期领先买单。同样,创业者在面对巨头时,需要找到自己的“非对称战场”——可能是速度、可能是服务、可能是社区生态。毕竟,AI诗词生成这样的创意工具,靠的就不是规模,而是对用户心理的精准把握。
FAQ
Q1: 什么是超大规模参数模型?它和AI创业有什么关系?
A1: 超大规模参数模型是指参数量达到万亿级别的AI模型,如字节讨论的5万亿参数模型。参数越多,模型通常能存储更多知识、处理更复杂任务。对于AI创业而言,这类模型作为底层基础设施,能提供更强大的API能力,帮助创业者快速构建应用,但也意味着算力门槛和竞争压力增大。
Q2: 字节跳动的5万亿参数模型与阿里Qwen、月之暗面K3相比,优势在哪里?
A2: 字节模型参数规模是阿里的2倍多、月之暗面的近1.8倍,理论上智能水平上限更高。但优势并非绝对,训练效率、数据质量、对齐技术同样重要。字节的搜广推基因使其在分布式训练和实时数据利用上具有独特经验,而张一鸣反对蒸馏的立场则可能推动其探索原创技术路径,实现真正的代际领先。
Q3: 张一鸣反对蒸馏的态度对AI行业有什么影响?
A3: 蒸馏是当前AI模型快速提升能力的常用方法。张一鸣公开反对,表明字节愿意承担短期落后风险,以换取长期创新。这对行业可能产生示范效应:鼓励更多团队投入基础研究而非简单复制,推动技术多元化。同时,也意味着AI创业公司若依赖蒸馏技术获取竞争优势,可能需要重新评估长期可持续性。
配图描述
A futuristic tech scene with glowing blue neural network nodes connecting across a massive data center, rows of GPU servers with blinking lights, in the center a holographic display showing a 3D model of a brain with "5Trillion parameters" text, digital binary code rain in the background, cinematic lighting, cyberpunk aesthetic, 8K resolution, photorealistic, by James Jean style.