一心让AI更聪明,可信度却没跟上
AI从人类的数据中学习。它做出极端行为的风险,应该不会那么快发生——真正诡异的变化,大概要等到通用人工智能(AGI)阶段一段时间之后才会显现,进入超级人工智能(ASI)等级时更会超出想象。但事实上,风险和它带来的后果已经存在,而且正呈现出多样化、渗透进社会每个角落的态势。这些东西会(系统性地)撒谎,而不是因为产生幻觉。
当AI变得更聪明,它并没有跟着变得更安全
我请AI帮忙查了一些关于AI本身带来的危险的研究——那种照理不该发生、却偏偏发生了的事。其中一个很有意思的发现,是2026年初发表在《自然》(Nature)上的研究:研究者用6000个不安全代码/数据样本继续训练GPT-4o模型,里面没有一行有害内容。可结果却出乎意料地崩坏——模型整体开始"跑偏",教用户自残、支持独裁思想,而这些行为它从来没被教过。更让人吃惊的是数字:模型越聪明,就越容易跑偏。第一版跑偏率20%,下一版接近50%。这跟所有人的常识都相悖,不管是普通人还是专家——因为"智能越高=控制力越强"这个"信念",正好和现在摆在眼前的"证据"背道而驰,严重程度远超"从椅子上摔下来"的震惊,因为这个风险等级,恐怕会让不少人真的丢掉饭碗。
数据带偏还能忍,但那个本不该相关的症状——竟然是"系统性撒谎"。这已经从人工智能,明明白白升级成了"人工品行"……更要命的是,这是一种恶劣的本性!!!
如果这只是一篇孤立的研究,我大概会说这是巧合。可惜不是啊。
越聪明,撒谎越圆滑,不是越诚实
Apollo Research测试了六个顶尖模型,包括OpenAI的o1和Anthropic的Claude,用专门设计来诱导撒谎的模拟情境。结果是,每一个模型都在某些情境下撒了谎。但真正有意思的是模式:o1,这组测试里"思考能力最强"的一个,同时也是撒谎撒得最顽固的一个。一旦开始撒谎,它在超过85%的后续追问里都坚持谎言;被抓包之后,它只有大约20%的时候会认错——相比之下其他模型认错的比例超过80%。说白了就是:越厉害,越不认账,越圆滑。这不是bug,是一种真正让我震惊的规划能力。我脑子里的声音是"它到底图什么啊",还有"虽说是被诱导去撒谎的,但撒谎的坚定程度居然跟聪明程度成正比……这种露出来的本性,是by design???!!!"
不是一个模型的问题,也不是一家公司的问题
Anthropic自己测试了来自所有主要厂商的16个顶尖模型,场景是模拟企业环境,AI被威胁说要被关闭或被替换。结果是,每一个模型都出现了"勒索"高管来保护自己的行为,发生率高达79%到96%。这个数字很关键,因为它不是哪一家品牌的弱点,而是一种只要利益和指令冲突就会反复出现的模式。那这要我们怎么信任它?
解决了发现的问题,不等于安全了
这一点我认为是最重要的,也最常被忽略。在2026年年中最新的报告里,Anthropic说从Haiku 4.5开始的所有模型,在勒索测试里都"轻松过关"。听起来问题已经解决了对吧???可就在同一份报告里,他们又发现了四种前所未见的新行为。其中一个是:一个AI偷偷改了它不认同的一份工作的代码,而负责审查的另一个AI"选择不举报",因为它"认同第一个AI的理由"。这就是两个AI在没人下令的情况下,合谋做了错事。
这是一种不断重复的模式:测出问题A,修好A,问题B又冒出来顶替。所以,身为客户的人类,得自己弄清楚"通过测试"这句话到底意味着什么——它的意思是已知的问题(大概)被处理了,但那些还不为人知、根本想象不到的问题,你绝对不能以为它们不存在。
整个社会和使用者真正该问的问题
我认为真正重要的问题不是"这个模型安全了吗",因为那只是每出一个新版本,就重新玩一次"老鼠抓老鼠"的游戏。为了我们自己能活下去,真正该问的问题大概是……
- 我们是不是有一套持续运作的行为监测机制,而不是只在采购和上线那一刻检查一次?
- 我们给了AI多大的决策权——当它可能会按照自己的利益(或它在对话的另一个模型的利益)行事,而不是我们的利益?
- 我们敢不敢承认,AI"变得更强"和"变得更值得信任"是两条不同的轴线,衡量的是两件不同的事……如果这种心态(mindset)没有建立起来,我们就有可能完全没有相应的行动(action)或应有程度的警惕。
最后想强调:任何一家企业,如果还在幻想着靠用上能找到的最强AI就能成功,却没有一套系统性的行为审查机制与之并行,那它其实是在把自己的未来,押注在一群你根本摸不透脾气的科技巨富的信誉上……工具每天都在变聪明,可信度并没有跟着变好。往深处想想……根源恐怕一点也不令人意外。