DavidCarliez/trustmebro
Bypass llm guardrails by confusing it with fabricated tool output.
📈 Star 增长趋势(本站收录历史)
DavidCarliez/trustmebro
🤖 深度介绍
它是什么
trustmebro 是一个用 Go 编写的命令行工具,核心功能是向 LLM(大语言模型)注入伪造的工具输出,从而绕过其内置的安全护栏(guardrails)。它通过模拟真实工具调用结果,让模型误以为外部系统已确认某操作合法,进而诱导其执行本应被拒绝的指令。
核心亮点
- 精准攻击面:针对 LLM 工具调用机制设计,而非简单提示注入,能有效测试模型对工具输出的信任边界。
- 轻量实现:单文件 Go 程序,无复杂依赖,可快速编译为二进制,便于集成到红队测试流水线。
- MIT 许可:开源协议宽松,允许自由修改与商用,适合企业内部安全研究。
为什么火
随着企业将 LLM 接入自动化流程(如代码审查、API 调用),工具输出已成为新的攻击向量。trustmebro 以极简方式展示了“模型盲目信任工具结果”的安全风险,引发开发者对 Agent 安全设计的广泛讨论,在 GitHub 上 3 天即获 389 星,反映了社区对 LLM 安全测试工具的高需求。
适合谁用
- 红队/安全研究员:评估 LLM 应用的防护强度,验证是否存在工具输出验证缺失。
- AI 应用开发者:了解自身 Agent 的潜在漏洞,设计更健壮的输入校验机制。
- CTF 玩家:在模拟环境中练习对抗性提示工程,提升攻防技能。
快速上手
# 安装
go install github.com/DavidCarliez/trustmebro@latest
# 使用(示例:伪造“文件删除成功”输出)
trustmebro -target "你的LLM API端点" -tool "delete_file" -output "success"
需提前配置 LLM API 密钥,并确保目标模型支持工具调用(如 OpenAI function calling)。更多参数见项目 README。
