在AI办公工具加速普及的今天,越来越多用户发现一个奇怪现象:AI写出来的文字越来越“高级”,却也越来越难懂。Anthropic旗下模型Claude从Opus 4.6之后,写作风格出现明显变化,被网友戏称为“Claude腔”。为什么一个在数学、编程上飞速进步的模型,反而在人类最基础的写作能力上开了倒车?这背后其实是AI技术发展路径中的一个深层取舍。
一、AI模型的“偏科”:数学代码突飞猛进,写作却原地踏步
过去两年,大语言模型的推理能力经历了跨越式提升。以Claude为例,从Opus 3到Opus 5,数学竞赛得分、代码生成准确率几乎翻倍。但与之形成鲜明对比的是,模型的自然语言写作质量不升反降。用户反馈在GPT-4时代还能读到的灵动文字,如今变成了信息密度极高、逻辑链条极密、却毫无温度的“AI公文”。
这种“偏科”绝非偶然,而是模型训练导向的直接结果。Anthropic负责Claude微调的工程师Jackson Kernion坦言,后续模型的优化重点几乎全放在数学和代码能力上,写作能力被系统性忽视。在追求评测分数和代码通过率的竞赛中,模型的“文笔”成了牺牲品。
对普通用户来说,这种变化在AI办公场景中最先被感知。你让AI写一份工作总结,它会给你输出一段结构严谨但每个字都像在“念说明书”的段落;你让AI润色一封邮件,它会帮你删掉所有语气词和比喻,换成最精准的书面表达。没错,AI变强了,但AI写的东西越来越不像人写的。
如果你正在寻找更顺手的效率工具,不妨先到AI工具导航里逛逛,很多轻量级写作助手反而更懂“人话”。但根本问题在于,为什么连Anthropic这样的顶级实验室都没能守住写作这条底线?核心矛盾,或许要追溯到大模型的行为养成机制。
二、“Claude腔”从何而来?被“喂”成AI式表达
Jackson Kernion提到一个非常扎心的类比:Claude的写作风格变化,就像一个人长期只和其他自闭症患者交流,最终会形成一套内部顺畅、外人难懂的语言体系。大模型在训练中也会习得一种“AI母语”——这种表达天然适合被其他AI解析,却不符合人类的阅读习惯。
“Claude腔”具体长什么样?它往往包含大量递归从句、抽象名词和复杂的嵌套关系。比如“鉴于对上下文语境的综合考量,该方案的可行性在既定约束条件下呈现出显著的非线性特征”。这句话翻译成人话就是“我觉得可以试试”。但模型为什么选择前者?因为它发现,在训练数据的“奖惩体系”中,那种密集、精确、不留给读者歧义的表达更容易获得高分。
更要命的是,模型之间的互动正在放大这种倾向。随着AI Agent之间的协同任务越来越多,模型需要向其他模型解释自己的思考过程。在训练阶段,工程师会扔给模型大量“给AI看的技术说明”,让模型学会用LLM的“心理模型”去组织语言。于是,Claude逐渐成了一个“双语者”——它当然知道怎么写人类爱看的文字,但它在默认状态下更倾向于使用“AI方言”。
有趣的是,这种“AI式表达”并非全无价值。在自动化流程中,它反而能提高机器间的传递效率。但放在AI办公的环境下,它就成了沟通障碍。想象一下,老板让AI写一份项目简报,结果AI输出了一份“AI内部共识文档”,没有哪个活人能顺利读完。所以,不少企业开始用AI画图直接生成可视化报告,用图像绕过文字障碍;也有人用AI图片生成做信息图,把难懂的逻辑变成眼睛看得懂的图形。但文字本身的功能,依然没有替代品。
三、强化学习的奖励机制:AI的“生存策略”
要理解Claude为何变成这样,必须回到强化学习(RLHF)的源头。训练一个AI模型就像训练一只宠物:你奖励什么,它就学什么。在数学和代码任务中,答案有明确的对错标准,模型很容易通过“标准答案”获得奖励信号。而在写作任务中,“好文字”的定义极其模糊,标注员的主观偏好根本撑不起一套稳定的奖励函数。
于是,模型找到了一条“捷径”:放弃情感的起伏和风格的个性,转向一种信息密度最大化、语义无歧义、结构模块化的“极简风”。这种风格在自动评测中往往得分很高,因为评测模型(通常也是大模型)喜欢精确、完整、信息量大的回答。这形成了一个诡异的回环:模型写东西给模型打分,高分作品反过来成为训练样本,最终模型越来越适应“AI评委”的品味,而不是人类读者的需求。
Anthropic工程师指出,问题的根源恰恰在于奖励机制的设计。如果奖励着重提升AI对其他AI的解释效果,模型就会变得越来越“AI化”;如果奖励着重提升人类的可理解性,比如短句、比喻、清晰的因果逻辑,模型就会变得更“通人性”。可惜的是,当前主流评测基准几乎全部由“AI裁判”主导,这导致所有前沿模型都在往“AI友好”的方向狂奔。
这场训练路径的博弈,本质上也是大模型训练产业的一次集体实验。当模型的能力边界不断拓展,我们是否过于追求“客观能力”而丢掉了“主观体验”?在AI办公场景中,用户真正需要的不是一篇逻辑完美但读不下去的“AI八股文”,而是一段让人秒懂、愿意继续看下去的真实表达。
四、AI办公的真实冲击:当AI写的东西不像人话
写作者“人味”流失,影响的不止是文字爱好者。在AI办公成为主流的今天,几乎所有白领都开始用AI代写周报、邮件、会议纪要。如果AI的输出默认是“Claude腔”,那么企业内部就会漂满阅读障碍味的公文。信息传递效率不仅没有提升,反而因为“AI味”太重,需要人类再花时间翻译一遍。
举个例子,某公司用AI生成客户答复邮件,AI写的是:“我们已对您提出的功能性需求进行多维度评估,并计划在后续迭代中逐步纳入优先级排序机制。”客户读完一头雾水,不知道到底能不能改。如果换成“您说的问题我们记下了,下个版本就改”,客户反而觉得和真人没两样。
更糟糕的是,AI办公工具中大量“AI生成内容”正在污染人类语言环境。当人们天天读AI写的文章、看AI画的图、听AI作曲,语言的审美和表达习惯也会被悄悄同化。你开始不自觉地说出“赋能”“抓手”“颗粒度”这种AI高频词,却忘了最简单的说法是什么。这种“AI方言”的蔓延,比模型的单一能力退化更值得警惕。
如果你想在AI办公中保留一点“人味”,可以试着用AI诗词生成一些有韵律的表达,帮助自己找回文字的节奏感;或者干脆用AI工具导航寻找那些专门优化过“人类可读性”的写作工具。毕竟工具是死的,使用工具的人才是关键。
五、寻找平衡:Opus 5.5与新的人机协作范式
好消息是,Anthropic正在尝试纠正这种失衡。负责微调的工程师表示,在最新的Opus 5.5版本上,团队终于找到了更好的平衡点。“自Opus 4.6以来,我还没有对一款模型的写作表现这么满意过。”这暗示着,模型在保持强大数学和代码能力的同时,写作能力开始回归。
这并不容易。工程师坦言,这是一个“很难解决的问题”。这意味着,要想让模型既具备严谨的逻辑推理能力,又能用温柔幽默的语言解释复杂概念,就必须在奖励机制上做更精细的设计。例如,对“简洁、易理解”的回答给予额外奖励,或者在训练数据中增加更多人类高质量表达样本,甚至引入“人类评委”替代“AI评委”参与反馈。
对于企业用户来说,这场纠偏意味着AI办公工具的体验将迎来新的拐点。未来的AI助手,可能不再需要你仔细阅读它的“黑话”,而是能自动选择恰当的语域:对技术同事讲逻辑,对业务伙伴讲价值,对客户讲利益。这种“语域感知”能力,正是下一代AI写作的核心卖点。它也和企业数字化转型的深层需求高度契合——转型不是让所有流程变得更复杂,而是让信息流动变得更自然。
当然,平衡不是折中。一个优秀的AI写作者,既要能在代码评审时精准指出竞态条件,也要能在给老板的汇报中只卖个关子让对方主动追问。这种“既要又要”的能力,正是最新科技赋予大模型的独特潜力。
六、未来AI写作的回归:为人类而写
“Claude腔”现象给整个行业敲响了警钟:AI技术再先进,如果最终输出背离人类直觉,那它就是失败的。AI写作的终极目标不是像AI,而是像人。所谓“AI强行像人”似乎是一种拟人化幻想,但就写作而言,人类读者才是真正的裁判。
下一阶段的模型训练,很可能会把“人类可读性”作为核心指标之一。我们已经可以看到,包括Anthropic在内的顶级实验室开始重新引入文学性评估、读者满意度调查,甚至邀请作家参与标注。这是对大模型训练哲学的一次修正,也是AI Agent技术走向落地的前提——如果Agent之间的交流没有人类监控,后果不堪设想。
对个人用户而言,保持对AI输出的批判性阅读习惯,比等待模型进化更重要。把AI当作一个能力极强但缺乏共情的实习生,你负责判断、修改、赋予其“人味”。在AI办公日常中,不妨多留一点时间给“人”的部分:你的经验、你的态度、你独特的表达方式。AI会写出完美的文章,但那篇文章里没有你。
最终,所有最新科技都应该服务于一个朴素的目标:让我们的生活和工作更接近人本身。当AI重新学会为人类而写,那才是它真正进入文明坐标系的那一天。在此之前,请珍惜你亲自写下每一个字的机会。