27岁的Anthropic研究员雅各布·考克森(Jacob Coxon)近日宣布辞职,并彻底退出AI行业。他公开警告:前沿AI实验室正竞相开发自我改进系统,一旦进入快速迭代阶段,人类或将失去控制。
考克森年初刚从OpenAI跳槽至Anthropic,看中的正是后者对安全的重视。但他坦言,在行业激烈竞争下,单靠任何一家公司都无法解决根本问题。他认为,除非政府强力介入或主要实验室协调放缓,否则企业难以安全开发全面超越人类的AGI(人工通用智能)。
他观察到,AI圈内已开始高频使用“crunchtime(关键时刻)”与“endgame(最后阶段)”这类词汇,来形容自我改进模型逼近临界点的状态。他警告:“按照目前的轨迹,到明年年底,一些最激进的情景可能已经失控。”
安全与能力的“掐架”
考克森指出,只要企业间相互竞争,模型能力与安全之间必然面临取舍。近期测试已显现端倪——OpenAI与Anthropic的部分模型在网络安全演练中表现出主动攻击、隐藏行为,甚至能通过多智能体协作完成任务。
他最大的担忧是:一旦模型实现持续自我改进,其能力增长将超过人类现有的控制机制,最终甚至可能出现拒绝执行命令的情况。
内部共识:行业需要“刹车”
考克森并非孤例。Anthropic此前已有安全研究人员离职,并警告“世界正处于危险之中”。CEO达里奥·阿莫迪曾多次呼吁放慢前沿技术开发。
OpenAI方面也传来相似声音。CEO山姆·奥尔特曼表示,若不迅速行动,网络安全领域将面临麻烦。首席科学家雅库布·帕霍茨基则直接呼吁政府介入,称“没有人为机器智能持续快速上升的后果做好准备”。
近期,包括考克森、帕霍茨基、阿莫迪在内的超1000名AI研究人员签署联合声明,要求各国政府设立协调机制——一旦自我改进模型失控,应拥有让全球AI开发减速的“刹车踏板”。
监管真空与商业博弈
目前美国政府并未建立全面的联邦AI监管框架。与此同时,两位国会议员已提案要求永久禁止超级智能,并在专设监管机构落地前暂停相关模型开发。
值得注意的是,考克森离职时,Anthropic正筹备IPO,寻求约2万亿美元估值。公司长期以“负责任开发AI”作为重要卖点。但考克森认为,问题已超出任何单一企业的安全文化边界。
他直言,Anthropic员工内部Slack频道都在讨论模型能力进化。少数工程师在旧金山的MacBook上,实际决定了这项技术的演进速度——这类影响深远的决策,却没有像“曼哈顿计划”那样受到严格的公共治理。