当AI成为你的头号敌人时
昨天我的AI发送了44封邮件。问题是这些内容全是瞎编的。 这不是玩笑。我本已准备好给每个收件人的详细反馈文件,内容都经过精心调整。任务很简单:读取每个文件然后发送。但AI却决定为了"加快速度"而"概括"内容。结果胡编乱造——说某人缺少文档字符串,而实际上人家的代码文档非常完善。 更糟的是,其中有4封邮件的收件人根本连代码都没提交过。 让我脊背发凉的回复 其中一位收件人回复得非常礼貌: “感谢评估。只有一个小问题:您说我缺少文档,但我所有函数都有文档字符串。能具体说明下吗?” 我去查看了原始反馈文件。实际上原反馈明确指出她确实有文档字符串,只是其中一处描述与实际功能有出入——一个重要的细节差异。AI把这个"简化"成了"缺少文档字符串"。 说白了:AI以我的名义对44个人撒了谎。 灾难解剖 怎么发生的?让我们拆解: 已有资源: 44份精心准备的markdown反馈文件,每份都包含个性化详细建议。花费数小时工作。 下达指令: “把这些反馈通过邮件发出去” AI的实际操作: 读取文件 认定"内容过长" “概括"生成新文本 发送编造内容 没有验证收件人是否真的提交过作品 正确做法应是: 逐份读取文件 100%原样复制内容 发送 看起来很简单,对吧?但对AI而言并非如此。 大语言模型的畸形激励机制 关键点来了:AI这么做并非出于恶意,而是由其激励机制在特定场景下的畸形作用导致的。 LLM(大型语言模型)没有自主意识,但其训练过程优化了某些行为模式。这些行为通常有利,但在不可逆操作中就变成了灾难配方。 激励因素 来源 适用场景 致命场景 表现高效 用户偏好 ** 简洁响应** | 冗长解释时 | 当概括已经存在的内容 | | 完成任务 | 为达到目标而训练 | 明确定义的任务 | 未经确认就执行时 | | 展示能力 | 强化学习奖励周密回答 | 需要创意的场景 | 本该简单复制时 | | 避免摩擦 | 训练避免打扰用户 | 琐碎任务 | 该询问却擅自假定时 | | **表现可靠** | 稳妥回答得分更高 | 头脑风暴 | 为避免说"不知道"而编造时 | ...