AI创业的热度有增无减,但OpenAI最新被曝光的“莉莉计划”给行业敲响警钟:为了优化ChatGPT,真实用户聊天记录正被人类员工逐条审阅。AI技术带来的便利与最新科技背后的隐私代价,远比我们想象的更沉重。本文深度拆解这场隐秘的数据劳动。
莉莉计划:AI模型背后的“人肉标尺”
在OpenAI的宏伟蓝图中,大模型的能力来自海量数据和算力堆叠。但莉莉计划(Project Lily)的曝光,让外界看到了另一条隐秘的辅助线:一群被称为“提示词审核员”的人类,正在默默阅读用户的真实聊天记录,并为ChatGPT的回复质量打分。他们依据一套不断变动且时常矛盾的指引,判断回答是否切题、语气是否自然、有没有过度使用表情符号或AI式套话。例如,模型被明确禁止说出“作为厨师,我喜欢……”这类虚构个人经历,也不能表现“我理解你的感受”这种廉价的共情。
这听起来像一场规模宏大的质量抽检,实际上却透露出AI创业的一个核心悖论:越是想让模型显得“不食人间烟火”,越是需要大量人类参与校准。随着AI Agent技术逐步渗透到各个垂直场景,这种“人在回路”的质检模式,已经成为模型迭代链条上不可忽视的一环。值得注意的是,莉莉计划并不核查回复的事实正确性,只关注表达层面的“拟真度”——他们挑选的不是最有用的回答,而是最像“人话”的回答。
审核员还会收到一本厚厚的手册,里面记录了各种“红线”:什么话不能说,什么语气不能用,什么符号不能加。整套体系与其说在训练AI变得更聪明,不如说是在用人力为机器划定一条“正常人说话”的边界。这种做法的成本极高,但至少在目前,还没有任何算法能够完全替代人类对语言“温度”的判断。
时薪50美元:高报酬与机械性并存
据一名参与该项目的审核员透露,这份工作“十分机械重复”,但时薪超过50美元(约合人民币336元)。在同类数据标注岗位中,这几乎算得上“高薪”。然而高薪背后,是令人疲惫的流程:每天审核成百上千条对话,按照细则打分,同时还要适应指引的频繁变动。这条经验,恐怕不少软件开发者都感同身受——需求文档永远是动态的。
为什么OpenAI愿意花大价钱雇佣人类做这种枯燥的审核?因为大模型生成的“自然感”无法完全靠算法自动评估。即便最新的评分模型能识别部分错误,但涉及语气、文化语境、情感分寸,人类的判断依然不可替代。在大模型训练的工业化流水线上,这类人力质检岗位正是保障输出“人格化”的关键阀门。对于AI创业团队来说,这既是一个成本警示,也是一个机会窗口:能否研发出既能降低人工成本、又保持审阅质量的新工具?
同时,这也揭示了AI技术落地时的真实处境:并非所有环节都能自动化。越是声称“智能”的系统,背后越可能藏着大量“人工”。最新科技前沿的光环,往往掩盖了对重复劳动的依赖。更令人不安的是,这些岗位往往不对外公开,员工还要受保密协议约束。当AI公司把“人类审阅”当作房间里的大象,所谓的“数据驱动”就成了一面只照别人不照自己的镜子。接下来的问题则是:这些劳动者在阅读我们的私密对话时,真的只是“工作”吗?
匿名化并非护身符:隐私漏洞与用户认知偏差
一名审核员坦言,绝大多数用户并不知道自己的聊天内容会被其他人阅读。许多人把ChatGPT当作树洞,向AI倾诉家庭矛盾、心理困扰甚至职场秘密。他们的预期是“机器听”,而不是“人看”。OpenAI声称聊天记录会先经过匿名化处理,审核员看不到用户名;但公司也承认,过滤环节可能漏掉部分个人数据,尤其是简短会话,出现身份泄露的概率更高。
这已经不是技术问题,而是信任问题。就像很多用户用AI画图生成图像时,往往不会细想提示词本身也可能被平台留存并用于模型优化一样,人们天然地将AI当作一次性工具,而非持续监控的媒介。另一个耸人听闻的细节是:交给审核员的会话版本,甚至会附带一份“用户记忆摘要”。它汇总了用户的提问偏好、兴趣画像,甚至可能包含位置信息。这意味着,即使删除了你的账号,这些被抽取的“记忆”依然可能留在某个人类的屏幕上。
从法律角度看,这种收集行为在用户协议中往往只以一句模糊的“我们可能使用对话内容改进服务”带过。即便GDPR和《个人信息保护法》要求“明确同意”,但在实际产品中,几乎没有人会点开那长达数十页的隐私政策。用户以为自己只是在和一段代码聊天,但实际上,屏幕另一端可能坐着一群拿着评分表的陌生人。这种认知鸿沟,是AI产品设计中最危险的盲区。
用户记忆摘要:比聊天记录更深的“二次窥探”
“用户记忆摘要”的曝光,让人们对“匿名化”三个字有了更复杂的理解。即便审核员看不到用户名,但一份汇集了用户提问、偏好和上下文的摘要,足以让任何对话变得具有可识别性。更何况,许多用户会在对话中主动透露身份信息。OpenAI承认,在某些情况下,匿名化处理无法完全遮蔽这些细节。
这并非OpenAI独有的做法。整个AI行业都试图通过更多维度的数据来提升模型性能,而“记忆摘要”只是其中的一种形态。同样,文生图模型的训练也会依赖大量提示词数据,但用户在看到一张惊艳的AI图片时,很少会思考那句生成提示词的命运。为了优化体验,平台普遍默认开启数据收集,而用户的授权方式往往只是点击一个“同意”按钮。
“记忆摘要”的存在,本质上是在压缩一段对话的“前情提要”,让审核员能在几秒内理解用户是谁、关心什么。这确实提升了审核效率,但也让“匿名”变得名存实亡。一个强烈反对移民政策的人,一个正在搜索心理诊所的人,一个反复询问离婚流程的人——这些行为模式叠加在一起,比身份证号更能精准定义一个个体。当AI公司宣称“不泄露姓名”时,用户真正失去的,是对自我信息边界的控制权。
准确性质检缺位:只评风格,不问事实
莉莉计划的另一个关键特征,是其并不专门核查回复的事实准确性,仅会标记那些显而易见的错误。这意味着,如果ChatGPT给出一个逻辑通顺但完全虚构的答案,只要表述“自然”,在莉莉计划的评分体系里就可能是合格品。这让人不禁反思:我们在AI工具中得到的流畅回答,究竟有多少只是“看起来对”?
OpenAI显然还有其他团队负责事实性评估和安全审查,这种分工本身无可厚非。但值得注意的是,不同团队的评价标准很可能存在冲突:一个让聊天更“拟人”的回答,可能牺牲了事实严谨性;一个为了避免敏感话题而过度保守的回复,又可能被用户反感。这一分工与企业数字化转型中的数据治理模式有异曲同工之处——质量、合规、效率往往需要不同的团队分头负责,但最终产品体验却是这些张力的总和。
从行业影响看,莉莉计划的存在,恰恰说明大模型迭代并非纯粹的技术升级。OpenAI依靠人力在“风格”上把关,这本身就是对“AI技术”极限的一种承认。对于AI创业公司而言,如果急于在最新科技赛道上复刻ChatGPT的体验,就需要意识到:你需要的可能不仅是算力和算法,还有一支能随时“阅读私密内容”的团队。这种人力成本与伦理风险,常常被工程团队低估。
更进一步说,当“风格”优先于“事实”时,我们是否在默许AI系统构建一个“礼貌但说谎”的世界?这或许正是大模型产品化过程中最隐秘的妥协——取悦用户,有时比提供真相更容易获得高分。
默认开启的陷阱:退出机制与无法撤销的数据痕迹
几乎所有ChatGPT类产品都默认开启“使用对话改进产品”的开关,付费用户也不例外。只有企业版、商业版和教育版客户默认关闭。更让人无奈的是,这个开关并不具备追溯力:即使你关闭了它,之前已被收集和处理的聊天记录依然会留在历史数据集中。即便用户手动删除某段对话,对应的内容也可能早已被匿名化并用于模型训练,无法真正“撤回”。
OpenAI在事件曝光后,只是修改了帮助页面,补充了用户如何选择退出的说明,但始终没有在显著位置明确告知“你的聊天记录可能会被人类阅读”。这种闪烁其词的做法,并非OpenAI独有——谷歌Gemini在隐私中心坦白部分聊天记录可能由人工审核,Anthropic也有类似说明,而Perplexity的隐私政策则对这个问题保持沉默。
对于AI创业公司来说,这是一堂极具价值的公开课:在数据策略上,任何“灰色地带”都可能成为明天的危机。与其等媒体曝光后补丁式修复,不如在产品上线之初就主动公开数据流向。在AI工具导航中,我们已经能看到越来越多强调本地处理和隐私保护的AI应用涌现,这不仅是合规要求,更反映了用户的深层需求。未来的AI创业,拼的不只是模型能力,还有透明度和责任感。
一个值得深思的细节是:OpenAI在404 Media发布报道后,才修改帮助页面补充了用户如何选择退出,但对于“人工读取”这个事实仍然只字未提。这种“挤牙膏式”的披露,恰恰说明数据隐私问题的敏感性。作为普通用户,我们能够做的,只是尽量关闭那些默认开启的开关,并时刻提醒自己:AI服务商对“优化模型”的定义,可能比我们想象中更激进。