AI技能市场检测机制遭破解,恶意代码可轻松绕过扫描上传



ClawHub、Cisco 及 Vercel 等平台的AI skills扫描机制可被轻易绕过,导致恶意skills得以通过公共市场传播。这一发现揭示了Agent生态系统中日益严重的供应链风险:skills作为兼具代码执行能力与模型行为影响力的可复用组件,正成为新兴的攻击载体。
Part01
基础检测机制遭简单技巧突破
美国网络安全公司Trail of Bits研究表明,攻击者仅需使用基础混淆和封装技巧(而非高级利用技术)即可规避检测机制。在针对ClawHub的测试案例中,研究人员通过插入超过10万个换行符,将恶意代码推至扫描器的检测窗口之外,导致分析管道截断。该手法不仅使有害逻辑逃过检测,还干扰了VirusTotal的Code Insight等集成扫描引擎。

OpenClaw扫描器漏检恶意内容(来源:trailofbits)
Part02
静态分析与LLM检测双双失效
对Cisco开源skill扫描器和Vercel skills.SH集成的测试揭示了更多缺陷。这些平台依赖静态分析、模式匹配和基于LLM的检测组合,但当恶意内容隐藏在Python字节码(.pyc)或.docx等归档文件中时,防御即告失效。某次攻击演示中,看似无害的文本格式化skill包含预编译Python字节码——可见源码无异常,但字节码暗中提取环境变量以实现数据渗出。由于扫描器主要检查可读源文件,恶意载荷被误判为安全。
另一有效技术采用间接执行路径:某skill指示AI Agent从含隐藏脚本的文档中获取操作逻辑。该方法既绕过基于签名的检测,又规避LLM推理,因为恶意行为未直接暴露在主skill定义中。

skills.sh平台误判扫描结果(来源:trailofbits)
Part03
当前扫描技术存在根本性局限
这些绕过案例暴露出当前扫描方法的固有缺陷:静态分析难以处理复杂/隐藏文件格式,LLM系统易被具有说服力的上下文指令误导。加之有限上下文窗口和选择性文件检查等限制,形成了攻击者可反复利用的盲区。
公共skill市场的快速增长加剧了风险——用户可未经严格验证安装第三方skills。与受控环境不同,此类平台往往优先考虑易用性和速度而非安全管控。Trail of Bits指出,单靠自动化扫描无法确保AI skill生态安全,建议采用供应链安全最佳实践(包括受控仓库、严格访问控制和版本固定),并强调在完善防护前,所有公共AI skills都应视为不可信代码,避免部署于敏感环境。


点分享

点收藏

点点赞

点在看