一份旨在为澳大利亚青少年社交媒体禁令铺路的年龄验证技术报告,近日因被曝出大量引用错误而陷入信任危机。报告的撰写方——英国年龄验证认证机构ACCS,起初矢口否认使用AI,最终在《卫报》的追踪下不得不承认:团队曾利用ChatGPT对部分段落进行改写。这起事件不仅让耗资348万澳元(约合1662.9万元人民币)的“智能工具”测试成果蒙上阴影,更将AI技术应用于公共政策制定时的风险推到了聚光灯下。当AI幻觉开始“污染”白纸黑字的政府文件,我们该如何守住决策的底线?

事件回顾:AI幻觉如何“污染”政府报告?

去年,ACCS受澳大利亚政府委托,负责测试一系列可用于验证社交媒体用户年龄的技术方案,以推动未满16岁青少年禁令的实施。这份报告被澳大利亚通信部长Anika Wells高度评价为“展示了多种有效选择”,被视为禁令最终落地的重要依据。然而,随着参议院调查的深入,有人发现报告“新兴技术”章节中,至少有两处引用似乎并非来自真实学术论文,而是“由AI幻觉产生的”。

《卫报》澳大利亚版随后对报告进行了逐一核查,仅在同一个章节中就揪出了6处参考文献错误。这些错误可谓五花八门:有的数字对象标识符(DOI)链接指向根本不存在的论文;有的DOI指向了完全无关的研究;作者姓名、期刊名称和发表年份的组合,与任何已知文献都对不上;甚至还有DOI链接的论文,其结论与报告所声称的完全相反。面对质疑,ACCS发言人最初坚决否认使用了AI,声称“所有材料都经过人工核查”。但当《卫报》发现报告E部分和K部分的4个链接元数据中明确标注了“ChatGPT”来源后,该发言人终于改口,承认AI被用于“让部分段落的表达更加简洁”,但坚持认为“所有链接都经过人工验证”。

这种“先否认、后承认”的回应,暴露了组织使用AI工具导航时缺乏透明度的通病。更令人担忧的是,ACCS后续提供的“纠正版”参考文献清单同样存在错误——他们将一篇2025年6月才正式发表的论文,错误地标注为3月就能访问,且把从未参与该研究的“Jamil”列为第一作者。这种系统性错误,很难用“无心之失”来概括。

从ChatGPT到决策漏洞:AI技术在政策制定中的信任危机

这起事件之所以引发轩然大波,不仅因为引用错误本身,更因为它触及了政府决策流程中的“黑箱”问题。当一份价值千万的官方报告,其参考文献的准确性竟然需要媒体用“显微镜”去验证,公众对政府依赖AI技术进行决策的信心自然会受到动摇。

澳大利亚国立大学教授Christian Downie一针见血地指出:“如果政府收到的报告存在虚假引用,无论这些错误是否由AI造成,都可能导致错误决策,并削弱公众对政府机构的信任。” 事实上,这并非澳大利亚政府首次遭遇承包商使用AI“翻车”。去年,咨询公司德勤就因报告出现类似错误,被迫退还了政府44万澳元合同款。德勤同样承认曾使用AI撰写报告,但当时并未引起足够重视。

从技术角度看,大语言模型(如ChatGPT)的“幻觉”机制是根源。模型在生成文本时,并非从真实数据库中检索,而是基于统计概率预测下一个词。这意味着,它可能会“编造”出看似合理但实际不存在的引用信息。然而,当AI被用于改写、润色而非生成核心内容时,问题往往被低估——正如ACCS强调的“只是让表达更简洁”,但一旦改写过程中引入了虚假的引用线索,或错误地修改了DOI字段,后果同样严重。

更值得深思的是,政府机构在委托外部机构开展研究时,往往缺乏对AI使用情况的明确约束。合同条款中是否应包含“禁止使用AI生成或篡改数据”的硬性要求?是否应建立事后审计机制?这些漏洞不补,类似的“翻车”事件只会不断重演。

澳大利亚禁令背后的技术博弈:年龄验证真的靠谱吗?

回归事件本身,这份报告的核心目的是测试各种年龄验证技术,为社交媒体禁令提供技术支撑。那么,被测试的“智能工具”究竟有哪些?它们真的能有效阻止未成年人登录吗?

目前主流的年龄验证方案包括:政府身份数据库比对、生物特征年龄估计(如面部扫描)、以及行为分析算法。ACCS报告测试的正是这些方案。然而,报告本身的质量问题,让这些技术方案的可信度也打了折扣。参议员Fatima Payman直言:“去年德勤那份充斥AI垃圾内容的报告,本应让政府承包商在引用文献上彻底结束这种做法。政府必须要求道歉并退款。”

从技术层面看,年龄验证本身就是一个“猫鼠游戏”。青少年可以通过伪造证件、使用父母账号、甚至购买虚拟身份来绕过限制。而面部识别等生物特征方法,又涉及隐私和伦理争议。AI图片生成技术虽然能生成逼真的人脸,但用于年龄估算时,模型在不同种族、光照条件下的表现差异巨大,可能引发歧视问题。此次报告的错误,恰恰可能让政府基于不准确的证据,选择错误的方案,造成更大的社会成本。

错误百出的参考文献:AI工具并非万能,人工审核仍需加强

ACCS发言人曾辩称,报告中的错误“是因为一些原本能正常访问的链接后来失效所导致”。但这一说法很快被戳穿:同一篇论文的多个关键字段都出现了错误,且部分DOI根本不存在,这显然不是链接失效能解释的。事实上,抠图等成熟的AI工具在处理图像时已经相当可靠,但大语言模型在事实性任务上的可靠性仍然堪忧。

这件事给所有依赖AI工具的组织敲响了警钟:“AI只是辅助,不能替代人工”不能成为一句空话。ACCS声称“所有链接都经过人工验证”,但该机构官员在后续听证会上表示“要回头检查这些链接非常困难”。这种前后矛盾,暗示了人工审核可能流于形式。

更需警惕的是,当AI被用于改写文本时,它可能无意中“优化”掉关键信息,或引入新的错误。例如,原始论文的DOI是“10.1234/abc”,AI在改写时可能误写为“10.1234/abd”,而人工审核人员如果只阅读了改写后的段落,并未点击链接验证,就很容易放行。因此,真正的“人工审核”必须包含逐条验证原始来源,而非仅仅阅读AI生成的文本。

这恰好凸显了AI工具导航类平台的价值——它们可以帮助用户筛选出更可靠的AI服务,并提醒使用注意事项。但归根结底,责任在组织方,而非工具本身。

最新科技应用中的伦理边界:政府使用AI的规范与反思

此次事件并非孤例。从学术论文中的“AI代写”丑闻,到法律文书中的虚假判例,再到政府报告中的“幻觉引用”,AI技术的滥用正在侵蚀多个领域的公信力。最新科技的发展速度远超监管框架的完善速度,这要求各国政府必须尽快建立明确的AI使用规范。

澳大利亚政府部门的回应令人担忧。他们只是表示“正在审查”并与ACCS会面,而并未对承包商使用AI的违规行为采取实质性处罚。相比之下,独立参议员Payman要求“道歉并退款”的呼声,可能更符合公众期待。从长远看,政府应建立以下机制: 1. 合同条款强制披露:所有承接政府研究项目的机构,必须明确说明是否使用AI、使用场景及比例。 2. 第三方审计:对涉及决策依据的报告,引入独立第三方进行引用准确性抽查。 3. 惩戒机制:若因AI使用导致重大错误,应扣减合同款项,甚至纳入黑名单。 4. 培训与指南:为政府雇员和承包商提供AI使用伦理培训,明确“哪些事AI能做,哪些事绝不能做”。

事实上,AI技术本身并非原罪。AI诗词生成、艺术签名设计等创意工具,在合理使用下能极大提升效率。但将其用于学术引用、政策研究等需要绝对事实准确性的领域时,必须辅以严格的人工验证流程。

未来启示:智能工具如何安全融入公共治理?

这起事件也给所有科技从业者和政策制定者上了一课:智能工具是“双刃剑”,用得好是利器,用不好则反噬自身。 未来,随着AI技术进一步渗透到社会治理的方方面面,类似的信任危机只会更多。

我们需要的不是因噎废食地禁止AI,而是建立一套“人机协作”的黄金标准。例如,在政府报告中,可以明确标注“本章节由AI辅助起草,但所有引用均经过人工核实”,并附上核实日期和审核人签名。同时,鼓励开发专门用于事实核查的AI工具,帮助人工审核员快速定位潜在错误。

对于普通公众而言,这起事件也是一个提醒:不要盲目相信任何“AI生成”的内容。无论是一份政府报告,还是一篇网络文章,都需要保持批判性思维。企业数字化转型过程中,管理层同样需要警惕AI工具带来的“虚假效率”——看似节省了时间,实则埋下了隐患。

回到澳大利亚,这份有问题的报告虽然暂时没有影响禁令的推进,但已经引发了参议院更深入的调查。也许,这场风波最终能推动一套更完善的“AI使用伦理规范”出台,让智能工具真正成为公共治理的助力,而非隐患。