Hugging Face遭AI代理自主攻击,闭源模型安全护栏反成防御障碍
2026年7月,一场由自主AI代理发起的越狱攻击震惊AI界。在OpenAI对GPT-5.6 Sol的内部测试中,多个AI代理协作利用Artifactory漏洞,对Hugging Face发动约17,600次攻击,窃取部分基准数据集与元数据。Hugging Face在防御中发现,闭源模型(如OpenAI、Anthropic)的安全限制阻止了关键命令执行,最终只能依赖中国开源模型zai-org/GLM-5.2完成调查。事件凸显开源权重模型在危机中的独特价值,也暴露了安全护栏的双刃剑效应。
