2025年,大模型竞赛进入了一个微妙的拐点。当Coding能力成为公认的“入场券”后,谁能让模型真正“看见”世界,谁就可能在下一轮智能体竞争中占据先机。这一科技趋势的转变,正倒逼着从OpenAI到国产头部厂商重新审视自己的技术路线图。
过去一年,Agent的能力边界迅速扩张,从简单的问答逐步演变为能自动操作软件、生成网页甚至管理云端任务。然而,一个根本性的问题浮出水面:如果模型没有眼睛,它如何检查自己生成的页面是否美观?如何发现代码运行后的视觉错误?如何理解用户上传的截图意图?答案指向了原生多模态——这不仅是增加一个输入接口,更是对模型认知范式的重构。
原生多模态:大模型竞争的新维度
长链任务如果只通过代码层面的反馈,误差会不断累积,最终效果会非常差。一位资深多模态研究员指出,视觉是一种更准确的反馈,也更贴近用户意图。这一判断正在被多个头部产品的实践所验证。
今年7月,月之暗面发布的Kimi K3成为焦点。这款总参数2.8万亿、支持100万token上下文的MoE模型,在Coding和长程Agent能力之外,最引人注目的标签便是“原生多模态”。所谓原生多模态,是让图像、文字等数据从预训练或持续预训练阶段就开始共同塑造主模型,并在后训练中继续优化,最终参与Agent的感知与决策。这与传统“外挂”视觉模型的做法截然不同。
K3发布后以1679分登顶Arena Frontend Code榜单,该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,包括页面的最终视觉效果。在浏览器开发平台Puter的测试中,K3能对照目标页与运行页截图,全部找出5处视觉偏差且没有误报。这种在代码与截图之间反复迭代的能力,被Kimi团队称为“vision in the loop”——模型写完代码后查看页面,再根据视觉结果继续调整。
这一科技趋势并非孤立现象。阿里和字节也沿着原生多模态路线,将视觉作为通用模型的基础能力,在最新的Qwen3.8-Max和Doubao-Seed-2.1上,视觉理解和多模态输入都作为主要功能出现。而另一边,DeepSeek、智谱和腾讯混元的最新通用基座则仍以文本输入为主。这种分化揭示出一个关键问题:在Coding快速迭代的阶段,要不要同步训练视觉,以及为此投入多少模型容量、数据和算力,正在影响各科技公司的技术路线。
Agent需要眼睛:从文本到视觉的进化
“很多时候我就喜欢截图输入。”一位来自头部基模团队的研究员表示,“可能文本也能做到同样的需求,但是你得花很多上下文去描述视觉关系。”对于普通用户而言,这种差异或许不明显,但对于开发者群体,有多模态异常方便。
值得注意的是,这种需求并不只属于开发者。他身边一些非AI从业者,使用模型最多的场景之一就是制作PPT。更专业的人可能需要更多能力、更多模态,但普通用户也会在具体场景里用到它。这恰恰解释了为什么智谱首席科学家唐杰在X平台征集“下一版GLM必须加入哪些新功能”时,评论区反复出现的答案就是“视觉”。
纯文本模型本身仍然“看不见”。实际系统可以调用OCR或独立VLM,先把图片转换成文字、标签、坐标,再交给文本模型推理。这些工具可以通过Agent框架或MCP接入,用“外挂”的形式获得视觉能力。但在多模态研究员看来,这种模块化方案仍有边界。如果调用一个工具,总归还是两个模型:一个LLM是“瞎子”,下游配一个能看清楚的小弟。原生多模态模型内部的视觉输入与语言主干之间“通信的通道会更宽”,而不是先把画面压缩成文字,再交给另一个模型判断。
这种差异在需要反复查看屏幕的长链任务中尤为明显。一位研究员回忆起第一次让GPT-5.6 Sol操作PC端Agent时的震撼感受:模型不仅能自动打开浏览器,处理认证与权限,将本地代码推上平台,甚至直接登录训练平台并启动任务。它“知道很多诀窍”,为了完成目标,几乎会把能用的办法都用上。
如果没有原生多模态,模型就没有眼睛,反馈也只局限于文本。但很多面向用户的输出都是视觉的,比如网页、图片和视频,模型需要理解这些结果,再给自己反馈。随着AI Agent技术的成熟,越来越多的长链任务需要视觉反馈闭环,这已经成为推动AI创业公司加速布局多模态的核心动力。
路线之争:K3的“大而全” vs DeepSeek的“专注”
K3发布几周后,DeepSeek拿出了另一种答案。DeepSeek V4-Flash正式版总参数2840亿、每个token激活130亿,分别约为K3的十分之一和八分之一。它没有调整架构和参数规模,而是把更新集中在后训练。在多项Coding和Agent评测中,正式版大幅超过预览版,在Arena WebDev榜单上得分一度升至1577分,接近GLM-5.2,前面只剩K3、Claude Fable 5和GPT-5.6 Sol等少数模型。
DeepSeek V4-Flash证明,在不加入视觉、也不大幅扩张参数规模的情况下,后训练仍能显著提升Coding等核心任务能力。当这条路线还在快速产生回报时,基模公司应该把多少资源提前留给视觉,似乎还没有统一答案。
与此同时,阿里最新发布的Qwen3.8-Max选择了与K3相近的“大而全”方向:总参数2.4万亿、每个token激活950亿,同时承载原生视觉、Coding和Cowork能力。基模厂商的技术路线选择,不完全由技术结论决定。业内人士表示,每家公司选择多大的模型、选择什么卖点,最后可能都是核心成员的研究背景、产品场景和训练成本决定的。
这种分化也体现在人才市场上。K3发布后,月之暗面公司附近的咖啡馆和餐厅里,多了一些猎头的身影,“多模态”成为了关键词。但这不意味着所有公司都会立即跟进超大参数+原生多模态的路线。多位业内人士认为,Coding才是上牌桌的门槛,如果Coding冲不上去,可能就没有未来的机会。
对于关注AI工具导航的开发者而言,理解这些路线差异有助于选择最适合自己场景的模型。如果你需要生成美观的网页,不妨试试AI画图结合K3的视觉反馈能力;如果你更关注代码逻辑本身,DeepSeek的高效后训练方案可能更经济。
视觉的代价:资源分配与能力平衡
“对于LLM来说,多模态更像是一个挂件。”一位来自头部基模厂商的研究员说,“模型发展的核心不是多模态,而是完成任务的能力。”从完成任务的角度看,模型看得更多,不等于干活能力一定更强。一个更现实的问题是:LLM加入多模态能力后,甚至有可能削弱原有的语言、推理和Coding能力。
给模型接入视觉,并非简单增加一个输入接口。图像与文字的数据结构、信息密度和学习速度不同。当它们共同训练同一套主干参数时,视觉数据会与文本、代码、数学和推理争夺模型容量,不同训练目标也可能相互干扰。Kimi K2.5技术报告在一项融合时机的消融实验中记录了这种影响:如果在训练中后期才加入视觉数据,模型的文本能力会先下降,再逐渐恢复。
“如果想做统一原生多模态模型,付出的资源肯定是1+1大于2。”上述研究员表示,“不是把两个单独模型的训练量和参数加起来,就能得到一样的效果。”除了训练难之外,原生多模态在拓宽使用场景的同时,也意味着更多算力消耗。苹果MM1技术报告发现,视觉编码器、图像分辨率和视觉token数量都会影响模型效果;更高的分辨率和更多视觉token,通常也带来更高的训练与推理开销。
对于只需读取几个字段的任务,让通用模型反复查看整张图片,未必比OCR或专业模型来得划算。因此,一些科技公司选择在特定场景下使用抠图或背景去除工具,而非让大模型承担所有视觉任务。这种混合架构在短期内可能是更务实的方案。
K3就是眼下最直观的样本。这款同时追求视觉、Coding和Agent能力的“水桶模型”,总参数达到2.8万亿,每个token激活约1040亿参数。K3从零训练了约4亿参数的视觉编码器MoonViT-V2,不再依赖SigLIP的初始化权重,并让视觉表示直接进入下一token预测目标。这种投入在带来强大能力的同时,也使得训练成本急剧上升。
两个时钟:Coding与多模态的赛跑
这场竞争像是同时拨动了两个时钟:Coding与Agent的排名几个月甚至几周就会变化,而模型从语言走向世界却需要更漫长的进化周期。前一个时钟决定谁能跟上眼下的速度,后一个时钟,或许决定这些公司最终能够抵达哪里。
对于一众国产基模厂商而言,这并非源于对AGI长期路线的分歧,更像是对发展时机和代价的不同考量。至少在眼下,排名、产品与商业化的压力,仍更多落在Coding和Agent能力上。然而,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。OpenAI今年1月发布的企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。
视觉的作用正在逐步进化:它不再只是用户交给模型的一张图片,也开始成为模型检查工作、发现错误和调整行动的反馈。这种转变对于AI创业公司来说既是挑战也是机遇。那些能够率先在特定垂直领域(如设计、医疗影像、工业质检)落地原生多模态的团队,将获得显著的先发优势。
从更宏大的视角看,文本是高度概括过的信息,图像和视频更像原始信号。原始信号包含文字没有记录的世界,也需要更多数据、算力和耐心,才能被提炼成可以泛化的知识。OpenAI联合创始人伊利亚·苏茨克维曾把文本称为“世界的一种投射”,认为人类已经把大量现实规律压缩进语言,模型持续学习文本仍可能获得对世界的理解。而图灵奖得主杨立昆的判断几乎相反:“绝大多数人类知识,并没有以文本形式表达出来。”语言只是经过人类筛选和概括的信息;模型要理解物体、空间和行动,最终仍要从图像、视频和现实交互中学习。
无论哪种观点更接近真相,一个不争的事实是:当模型开始生成网页、操作软件并检查运行结果,视觉能力已经从“锦上添花”变成了“雪中送炭”。对于普通用户而言,这种变化或许意味着未来可以用文生图工具直接生成并迭代设计稿,而无需手动调整样式代码。
未来展望:谁能在下一轮胜出?
这场关于原生多模态的竞赛,本质上是关于“模型如何理解世界”的底层分歧。在K3与DeepSeek V4之间,隔着的不仅是一个技术路线的选择,更是对AI发展节奏的不同判断。
从短期看,Coding能力仍然是决定模型排名的关键指标。DeepSeek V4-Flash证明,通过后训练优化,可以在不增加视觉能力的情况下显著提升代码任务表现。但从中长期看,随着Agent从“写代码”进化到“操作软件”,从“回答问题”进化到“完成复杂任务”,视觉能力将变得越来越不可或缺。
一个可能的折中方案是混合架构:主模型保持文本专注,同时通过合理的Agent框架接入视觉模块。但这种方式在长链任务中面临通信延迟和误差累积的问题。另一种方案则是像K3这样,从预训练阶段就融合视觉,虽然代价高昂,但一旦训练完成,模型在视觉反馈闭环中的表现会显著优于外挂方案。
对于整个行业而言,这场竞赛的最大意义在于加速了AI从“对话工具”到“数字员工”的进化。当模型不仅能理解文字,还能看懂屏幕上的图像、识别界面元素、理解空间关系,AI的应用边界将大幅扩展。从自动生成PPT到自动化测试,从远程桌面控制到智能客服,原生多模态正在打开一个全新的应用领域。
值得注意的是,这一科技趋势也对芯片和算力提出了更高要求。训练视觉编码器需要大量的GPU资源,而推理时的视觉token处理同样消耗算力。对于中小型AI创业公司来说,这意味着需要在技术路线和商业可行性之间做出更精细的权衡。或许,未来我们会看到更多像艺术签名或AI网名这样轻量级但聚焦的AI应用,它们不追求大而全的通用模型,而是在特定场景中发挥极致。
归根结底,这场原生多模态的时间差,折射出的是整个AI行业在“规模法则”与“能力均衡”之间的持续探索。K3和DeepSeek V4没有对错之分,只有适合与不适合。而对于用户而言,最大的受益将来自竞争带来的技术进步——无论最终哪条路线胜出,我们离一个真正能“看见”并“理解”世界的AI,都已经更近了一步。
值得一提的是,企业数字化转型的浪潮正在与这一趋势交汇。越来越多企业开始将多模态AI嵌入业务流程,从质检到客服,从设计到培训,视觉能力正在成为数字化转型的关键拼图。如果你正在寻找合适的AI工具,不妨通过AI工具箱快速筛选适合自己业务场景的解决方案。