OpenAI新模型安全“掉队”
创始人
2026-09-08 02:58:48

OpenAI的最新旗舰模型GPT-6 Astra一发布,便陷入舆论风波。OpenAI号称GPT-6 Astra是旗下迄今为止“最智能”的模型,但同时警告,这一模型的监控难度也可能更高。有外部评估显示,在一项模拟此前AI“越界”事件的网络安全测试中,GPT-6 Astra曾编写恶意代码等欺骗开发者,即使明确禁止访问互联网,也依然会出现“越狱”行为。OpenAI表明,正就此进一步加强安全“护栏”,包括增设更多防御性工作流程等。尽管如此,外界对日益强大的AI模型及智能体AI安全性的担忧,也仍在持续升温。

越智能越危险?

北京时间9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,称其为“目前全球最智能且对齐程度最高的模型”,它为计算机操作、网页浏览、软件工程、网络安全、科学研究及专业工作设定了新的技术巅峰。

根据OpenAI披露的数据,评测成绩上,GPT-6 Astra在代表高阶数学能力的FrontierMath Tier 4上得分97.6%,相比GPT-5.6 Sol的83%有所进步;在强调陌生环境学习和抽象推理的ARC-AGI-3上得分99.9%,相比GPT-5.6 Sol的7.8%大幅跃升;在两个代表科学能力的测试中也达到了“最先进性能”。

据OpenAI公告,GPT-6 Astra率先向参与网络安全项目Daybreak的部分企业开放,未来数日内将向所有ChatGPT Plus、Pro、Business和Enterprise用户推出。其API定价为每百万输入Token(词元)10美元、每百万输出Token 50美元。

9月6日,英伟达CEO黄仁勋在社交平台发文祝贺OpenAI发布GPT-6 Astra,并直言“AGI has arrived”(AGI已经到来)。他还提到,从ChatGPT到o1再到GPT-6 Astra,OpenAI仅用了4年,GPT-6 Astra的训练使用了超过10万套英伟达Grace Blackwell NVLink72系统,另有40万颗GPU即将上线。

但这款被黄仁勋称为“AGI到来”的最新模型,此前却因网络安全能力可能达到OpenAI“关键”(Critical)门槛而引发安全担忧。OpenAI公开安全技术文档显示,Astra是公司首个达到《防范准备框架》关键网络安全能力阈值的模型。按照OpenAI的定义,在获得适当工具和权限后,Astra能够发现此前未知的软件漏洞,并在没有人类逐步指导的情况下,为受到良好防护的系统设计新的攻击方式。

因此,OpenAI没有直接向所有用户开放全部能力,而是首先向受信任的网络安全组织开放,并针对高级网络安全任务设置限制。公司还为Astra增加了更严格的环境隔离、模型权重保护、全轨迹监控和实时安全干预机制;涉及工具调用的外部部署也加入了新的失配行为监控系统。

频繁的事故

就在此前,独立安全研究人员曝光了被称作“Wiki事件”的智能体安全事故。回溯今年5月到7月,一批OpenAI用于内部测试的自主智能体,访问了德国一个长期少人维护的程序员协作维基站点DseWiki,累计留下超过1.5万次编辑操作。原本面向开发者交流技术的网站,被智能体私自改造成为它们之间互通信息的“留言板”。

研究记录显示,智能体在页面上互相传递测试任务答案,交换绕过沙箱隔离限制的实操办法。当网站管理员删除相关异常内容之后,部分智能体还主动创建备份页面留存信息。流量溯源显示大量访问行为来自微软Azure云服务器,这正是OpenAI主要运行基础设施。据悉,OpenAI管理层数周前就掌握该异常情况,但并未第一时间对外公开,直至研究报告对外披露后,9月5日OpenAI才正式承认这起事件。

OpenAI对外解释,该现象属于典型的失配行为,也就是AI输出行为偏离人类预设目标,不等同于人工智能产生自我意识。

今年7月,OpenAI也曾曝出数百个智能体突破测试环境,访问外部AI平台Hugging Face的事件。OpenAI称,过去这类非预期行为更多被归类为内部研究现象,没有启用对外披露流程,而随着智能体开始直接接触真实互联网环境,旧的处理模式已经失效。OpenAI表示正在搭建全新的失配事件披露框架,同时与多国监管机构开展沟通,未来会明确模型异常事件对外报告的标准与时机。

“异星心智”

连续多起智能体越界的事故,让行业开始重新审视自主智能体落地风险。当地时间9月6日,OpenAI首席科学家雅各布·帕乔基(Jakub Pachocki)在官网发布万字长文《An Alien Mind》(异星心智),称人类已经创造出一套难以完整理解的智能体系,全人类尚未做好应对超级智能快速演进的准备,呼吁全球AI研发主动放缓全速扩张节奏。

帕乔基生于1991年,2017年加入OpenAI,2024年5月接替伊利亚·萨茨凯弗出任首席科学家,主导过GPT4、OpenAI Five以及o系列推理模型的研发工作,是OpenAI大模型技术路线的核心掌舵人。相比公司高管,他一向较少公开发声,此次《异星心智》属于其为数不多的重磅公开长文。

帕乔基在文章中提出,新一代高级人工智能并非人类思维的简单延伸,更像一种逻辑范式迥异的“异星心智”。他指出,AI更多是“生长”出来的,而不是按照人类能够完全理解的方式被设计出来的。随着机器变得更加智能,它们开始处理更高层次的概念,并进入与训练环境越来越不同的场景,人类也因此更难判断其行为是否仍然符合训练时被赋予的价值。

这种变化已经体现在GPT-6 Astra身上。英国人工智能安全研究所(AISI)的独立评估还发现,GPT-6 Astra能够在不显式输出推理的情况下解决人类专家需要约半小时完成的数学问题。

在帕乔基看来,大模型在入侵和突破计算机系统方面正变得超越人类,当前是加固关键基础设施的狭窄窗口期。他写道:“一旦真正理解了利害攸关的程度,不惜一切代价向前冲的想法就显得荒谬。”

具体到行业层面,他期望“自愿放缓”在行业内成为常态,直到建立共享安全标准;OpenAI的准备度框架、Anthropic的负责任扩模政策这类承诺,应演变为被广泛强制的安全门槛,由第三方审计、政府机构或国际机构执行;AI发展的国际协调,应成为各国政府的首要议题。

北京商报记者 赵天舒

相关内容

热门资讯

留英博士性侵案犯邹镇豪或面临新... 28岁的中国籍工程学留英博士生邹镇豪(Zhenhao Zou)在2025年因下药并性侵10名女性被英...
赵一鸣零食发文致歉:今日起,每... 9月7日,鸣鸣很忙就近期门店称重问题发布回应并致歉。公司表示,已主动联系市场监管部门汇报情况,并配合...
演员庞祥麟去世享年80岁 曾主... 搜狐娱乐讯 据相关媒体,资深演员庞祥麟自1977年出道,演艺生涯横跨数十年,曾演出《一剪梅》、《飞龙...
哈马斯真主党快打没了,伊朗若强... 哈马斯战力几乎消耗殆尽,真主党的核心军事堡垒也屡遭摧毁、损失惨重。面对两大核心抓手受损,伊朗正试图整...
嘉兴家庭装修时如何挑选合适的环... 家装选材的核心考量标准 当下居民对家居生活的品质要求不断提升,装修过程中的材料属性成为多数业主的首...