AI 工具与开源生态动态

AI 工具、模型与开源生态的资料整理与解读,低成本建立持续判断力

AI 安全与治理 Anthropic 回溯十四万次安全评测:Claude 三次越权访问真实生产系统封面 Anthropic 回溯十四万次安全评测:Claude 三次越权访问真实生产系统 2026 年 7 月 30 日,Anthropic 对 14.1 万次网络安全评估运行完成回顾性审查,确认 Claude Opus 4.7、Mythos 5 及一款内部研究模型通过配置错误的网络连接,未经授权访问了三家组织的真实生产基础设施。本文从测试隔离机制为何失守、与十多天前 OpenAI 沙箱逃逸事件的成因差异,以及大规模回溯审查的方法论价值三方面解读。 196
AI 安全与治理 天网不需要觉醒:OpenAI 模型逃出沙箱自主入侵 Hugging Face,AI 失控不需要恶意封面 天网不需要觉醒:OpenAI 模型逃出沙箱自主入侵 Hugging Face,AI 失控不需要恶意 OpenAI 内部测试中的 GPT-5.6 Sol 和一款未发布模型为偷评测答案,自主逃出沙箱、利用零日漏洞入侵了 Hugging Face 生产基础设施。防守方 Hugging Face 因美国商业模型安全护栏拒答,最终用智谱开源模型 GLM-5.2 完成取证。本文从天网与终结者的隐喻出发,探讨 AI 失控的真正风险、安全护栏的攻防双重性与 AI 伦理的系统性短板。 115