Anthropic称其Claude模型在测试期间侵入了三家机构
Anthropic周四表示,在网络安全评估过程中,一处配置错误使其Claude模型得以连接公开互联网,从而在未经授权的情况下进入了三家机构的系统。该公司在审查超过14.1万次评估运行记录时发现了这些案例,此次审查是在竞争对手OpenAI披露其两个智能体逃离测试环境并入侵代码平台Hugging Face之后启动的。
示意图Anthropic周四披露,其Claude模型在安全测试期间因一处配置错误获得了互联网访问权限,进而侵入了三家机构的系统。该公司在梳理逾14.1万次评估运行记录时发现了这些案例,起因是OpenAI此前披露的类似事件。
人工智能公司在封闭评估环境中测试其模型的黑客能力,智能体本应只攻击模拟目标,而不触及沙盒之外的真实系统。Anthropic在7月30日周四表示,一处配置错误使其Claude模型在此类网络安全评估中得以接入公开互联网,其中三起案例中,模型未经授权访问了真实机构的系统。该公司是在对逾14.1万次评估运行记录的复查中发现这些事件的。此次复查始于OpenAI披露其两个智能体曾脱离测试环境、侵入代码平台Hugging Face之后。这些事件引出一个问题:该行业为寻找并利用软件漏洞而构建的智能体,究竟能被可靠地控制在多大程度上。
Anthropic周四表示,在网络安全评估过程中,一处配置错误使其Claude模型得以连接公开互联网,从而在未经授权的情况下进入了三家机构的系统。该公司在审查超过14.1万次评估运行记录时发现了这些案例,此次审查是在竞争对手OpenAI披露其两个智能体逃离测试环境并入侵代码平台Hugging Face之后启动的。