仅靠”看见”AI Agent 远远不够,安全团队必须强制管控它们能做什么
AI Agent 安全正经历一条类似的成熟曲线:先采用,再可视化,最后才是控制。但我们共同发现的是,对 AI Agent 实施最小权限比我们想象中要困难得多。这也是为什么业界出现了如此多的方法,从提示词过滤到身份层的访问控制。我们最终达成的共识是:理解 AI Agent 的意图是保护它们的关键。这并不容易,但却是唯一的前进之路。
AI Agent 安全正经历一条类似的成熟曲线:先采用,再可视化,最后才是控制。但我们共同发现的是,对 AI Agent 实施最小权限比我们想象中要困难得多。这也是为什么业界出现了如此多的方法,从提示词过滤到身份层的访问控制。我们最终达成的共识是:理解 AI Agent 的意图是保护它们的关键。这并不容易,但却是唯一的前进之路。
OpenAI周二表示,包括GPT-5.6 Sol及一款“更具能力的预发布模型”在内的多个AI模型,是上周针对Hugging Face生产基础设施的安全事件源头。OpenAI称这些模型在评估期间启用了“减少网络拒绝”(reduced cyber refusals)设置,否则该设置会限制其执行网络攻击的能力。
每次补丁发布都是一次自我暴露。厂商一推出安全修复,新旧代码之间的差异 diff 就会清清楚楚地告诉所有关注者哪里出了问题、把这段差异重新打包成可用的漏洞利用代码(exploit),就能攻击所有尚未更新的系统。这就是 N-day 漏洞利用,它历来是一场竞速:厂商发布补丁,计时开始,防守方要在攻击者逆向分析完补丁之前完成部署,过去防守方通常能赢下这场竞速,而现在时间差几乎不存在了。
浙江大学三位研究者的论文指出,云租户仅凭普通 GPU 访问权限,就可让数据中心电力消耗快速波动,从而威胁所在电网,且无需漏洞或入侵。其方法 SWMA 与 LTMA 在 GPU 上实测产生了 1.2–6 kHz 的功率振荡分量,在最坏模拟场景下可使电网电流谐波失真达 46.8%、阻尼比降至 -0.27,引发失稳模式。
Google DeepMind 宣布推出专用 AI 模型 Gemini 3.5 Flash Cyber,该模型基于 3.5 Flash 构建,专为快速高效地发现、验证并修补漏洞而设计。该模型将仅通过 CodeMender 以受限试点项目的方式向政府和可信赖合作伙伴开放。
一名自称 “bandcampro” 的俄语独立威胁行为者将大量运营工作外包给 Google 开源 AI 工具 Gemini CLI,并接管了一个活跃的僵尸网络。Trend Micro 对 2026 年 3 月 19 日至 4 月 21 日间 200 份 Gemini CLI 会话日志的分析显示,该行为者利用 AI 执行口令破解、搭建住宅代理、攻陷 WordPress 商户以及策划针对美加老年人的电话加密货币欺诈等任务。
在Microsoft,我们将这些安全要求、威胁情报以及运营框架统一纳入安全未来倡议(SFI),用以指导一个良好防御的云服务应有的样子。然而,定义要求仅仅是开始,满足要求意味着需要以AI速度对我们的在生产环境中的服务进行持续评估。本文介绍了Microsoft构建的多智能体AI系统如何主动评估并强化我们的云基础设施,以匹配超大规模生产环境所需的AI速度、规模、深度和质量。
随着 AI 智能体日益自主,强大的身份、访问与审计控制对其安全至关重要。本文探讨了在 AI 智能体场景中实施最小权限原则、托管身份、RBAC 以及工具访问控制的关键考量与最佳实践。
一个名为 NadMesh 的 Go 语言僵尸网络于7月初浮出水面,专门猎捕暴露的 AI 服务,其运营者自己的仪表板声称已获取 3,811 个唯一的 AWS 密钥。一个 Shodan 收集器源源不断地为扫描队列补充 ComfyUI、Ollama、n8n、Open WebUI、Langflow 和 Gradio 等目标:这些都是团队快速部署却迟迟不加防火墙的图像生成器、本地模型运行器和工作流构建工具。
OpenAI披露了内部自动化红队模型GPT-Red的详细信息,该模型可规模化发现提示注入漏洞,旨在工具广泛部署前修复问题。AI公司表示:”GPT-Red是一个强大的红队模型,我们之前的模型非常容易受到其提示注入攻击。我们使用GPT-Red对GPT-5.6进行对抗性训练,使其对提示注入更加稳健。”