← 返回总览

DavidCarliez/trustmebro

Bypass llm guardrails by confusing it with fabricated tool output.

389Fork: 38语言: Go协议: MITGitHub ↗

📈 Star 增长趋势(本站收录历史)

097.25194.5291.7538908-3109-0109-02DavidCarliez/trustmebro 2026-08-31: 333DavidCarliez/trustmebro 2026-09-01: 360DavidCarliez/trustmebro 2026-09-02: 389
DavidCarliez/trustmebro

🤖 深度介绍

它是什么

trustmebro 是一个用 Go 编写的命令行工具,核心功能是向 LLM(大语言模型)注入伪造的工具输出,从而绕过其内置的安全护栏(guardrails)。它通过模拟真实工具调用结果,让模型误以为外部系统已确认某操作合法,进而诱导其执行本应被拒绝的指令。

核心亮点

  • 精准攻击面:针对 LLM 工具调用机制设计,而非简单提示注入,能有效测试模型对工具输出的信任边界。
  • 轻量实现:单文件 Go 程序,无复杂依赖,可快速编译为二进制,便于集成到红队测试流水线。
  • MIT 许可:开源协议宽松,允许自由修改与商用,适合企业内部安全研究。

为什么火

随着企业将 LLM 接入自动化流程(如代码审查、API 调用),工具输出已成为新的攻击向量。trustmebro 以极简方式展示了“模型盲目信任工具结果”的安全风险,引发开发者对 Agent 安全设计的广泛讨论,在 GitHub 上 3 天即获 389 星,反映了社区对 LLM 安全测试工具的高需求。

适合谁用

  • 红队/安全研究员:评估 LLM 应用的防护强度,验证是否存在工具输出验证缺失。
  • AI 应用开发者:了解自身 Agent 的潜在漏洞,设计更健壮的输入校验机制。
  • CTF 玩家:在模拟环境中练习对抗性提示工程,提升攻防技能。

快速上手

# 安装
go install github.com/DavidCarliez/trustmebro@latest

# 使用(示例:伪造“文件删除成功”输出)
trustmebro -target "你的LLM API端点" -tool "delete_file" -output "success"

需提前配置 LLM API 密钥,并确保目标模型支持工具调用(如 OpenAI function calling)。更多参数见项目 README。