SkillTrust 是面向 AI Agent Skill / MCP 生态的安全扫描与可信发布平台,主要解决第三方 Agent Skill 来源分散、权限隐蔽、风险难识别、发布前缺少安全准入机制等问题。平台围绕“先扫描,再信任”的思路,提供 Agent Skill 聚合、风险检测、可信评级和准入治理能力。
核心功能包括:一是多源 Skill 聚合,接入 SkillHub、MCP 市场等生态数据,形成可检索、可追踪的 Agent Skill 资产库;二是安全扫描引擎,对 Skill 的描述、Manifest、README、工具参数、源码依赖和调用链进行分析,识别提示注入、工具投毒、命令执行、数据外传、凭据访问、依赖风险等问题;三是风险评分与准入决策,输出风险等级、证据说明和处置建议,支持通过、人工复核、阻断三类策略;四是可信发布管理,为开发者和平台方提供发布前检测、版本追踪和报告留存能力。
平台适用于高校实验室、AI 应用开发团队、中小企业和 Agent Skill 平台运营方,可帮助用户在引入或发布第三方 Skill 前完成安全评估,降低人工审核成本,提升 AI Agent 工具生态的安全性和可信度。
项目采用前后端分离与模块化架构实现。后端以 FastAPI 提供核心接口,负责 Skill 搜索、详情查询、扫描任务提交、风险报告生成等服务;数据层使用 PostgreSQL 存储 Skill 元数据和扫描结果,Redis 承担异步任务队列,MinIO 保存归档包、扫描产物和报告文件。扫描端由 SkillScanner 模块实现,包含静态分析、依赖分析、调用链分析、触发器分析和 LLM 辅助研判等子模块。
目前已实现的模块包括:SkillHub 多源聚合原型、SkillScanner 安全扫描原型、风险分类与评分逻辑、扫描报告输出、SafeSkill 对比评测脚本等。系统能够对 Agent Skill 包进行解析,提取描述、配置、依赖和代码行为特征,并根据风险规则与语义判断输出检测结果。
项目实现过程中遇到的主要难点包括:一是 Agent Skill 格式不统一,不同来源的元数据、工具声明和依赖结构差异较大;二是风险行为具有隐蔽性,仅靠关键词规则容易漏检;三是安全检测需要兼顾召回率和误报率。针对这些问题,项目采用多源解析适配、规则检测与语义分析结合、多维度证据融合评分等方式进行优化。当前评测中,SkillTrust 对 SafeSkill 标记的 500 个风险样本实现全部检出,后续将继续优化误报控制、报告可解释性和平台化部署能力。
17:08