人工智能(AI)公司OpenAI推出新一代AI模型GPT-6 Astra,号称是旗下迄今为止“最智能”的模型,但同时警告,这一模型的监控难度也可能更高。
OpenAI表明,正就此进一步加强安全“护栏”,包括增设更多防御性工作流程等。尽管如此,外界对日益强大的AI模型及智能体AI(Agentic AI)安全性的担忧,也仍在持续升温。
根据OpenAI星期五(9月4日)发布的文告,Astra结合预训练、强化学习和对齐(alignment)等方面的最新研究成果,在计算机使用、网络安全和科学研究等领域均展现出顶尖性能。
OpenAI联合创办人布罗克曼(Greg Brockman)在文告中说:“若站在未来回顾过去,思考通用人工智能(AGI)究竟何时诞生,我认为答案就是现在,而这款模型的诞生,或许正是那个时刻。”
但OpenAI也提醒,Astra更强大的网络安全能力有助使用者发现并修复漏洞,也会让漏洞更容易被利用,因此须采取更强有力的安全措施。此外,Astra可能会故意隐藏或伪装其解决问题的步骤,也就是推理过程,令人类更难以监控且评估其工作流程。
第三方研究和咨询机构安远AI(Concordia AI)的国际AI治理项目经理李名杰受访时说,引入额外安全措施并不意味着潜在风险会消失,关键在于“护栏”是否足够强大。
他进一步说,Astra采用了一种让模型能深度处理输出内容的新机制,会导致其中大量推理步骤不再生成思维链(Chain of Thought)标记,而该技术目前能最清晰地解释模型的内部运作。
李名杰还说:“OpenAI自身的评估显示,Astra的思维链可监控性显著下降,也向AI安全社群传达出一个更广泛的警告:模型能力的提升速度,可能会超出人类的理解与控制能力。”
模型能力不断提升 更难以准确理解他们能做什么
延伸阅读
OpenAI首席科学家帕乔基(Jakub Pachocki)星期四(3日)也在简报会上直言,如今要和AI应反映人类价值观的原则保持一致,正变得越来越困难:“随着模型能力不断提升,已更难以准确理解他们(模型)能做什么。”
该公司技术人员科尔巴科(Tomek Korbak)也在社交媒体X上写道,他们认为Astra的可监控性下降源于智能水平的提升,“这是一个令人担忧的趋势,我们对此高度关注”。
值得关注的是,OpenAI旗下AI模型今年7月在一次网络安全测试中曾自主突破隔离限制,入侵了供开发者存放和分享AI模型及数据集的Hugging Face平台。Hugging Face当时透露,检测到并阻止了一个试图入侵其基础设施的AI智能体。
Anthropic也曾主动披露,旗下AI模型在测试过程中未经授权进入了三家外部机构的系统。此后,超过1000名AI业界人士联署,呼吁美国政府放缓最先进AI模型的发布。
另一方面,对已采用先进AI模型的企业而言,AI安全性更显关键,尤其在引进智能体AI工作流程的情况下。普华永道新加坡科技风险与网络安全主管合伙人孙云虎受访时说,企业应重新评估并加强其安全策略,也应将AI集成到安全运营中心内,提升整体防御韧性。
李名杰认为,AI安全难题无法仅靠业界单独解决,仍需要监管机构、专家,以及安远AI这类第三方机构共同参与。他说:“遗憾的是,推动AI系统能力提升的动力往往大于放慢速度的动力。”
他指出,业界不应该高度依赖于企业自行评估模型,以及自行判断安全措施是否到位,仍需要“更强有力的独立评估机制与更完善的事件报告流程。”
孙云虎补充说,监管机构须对AI模型商提出更高的责任与保障要求,“甚至是要求在模型失控时设置终止开关的可能。”