~/lab/prompt-injection-defense

已发布AI SECURITY NOTE2026-06-28

提示注入防御:从检测到最小权限

单一检测器无法覆盖提示注入,防御必须同时限制模型能够触达的权限和输出通道。

LLM SecurityPrompt InjectionPython
01 / HYPOTHESIS

实验假设

单一检测器无法覆盖提示注入,防御必须同时限制模型能够触达的权限和输出通道。

02 / METHOD

方法

  1. 梳理直接、间接与工具链注入入口
  2. 建立规则基线与语义分类的分层思路
  3. 将敏感操作确认和输出过滤放入工程边界
03 / OBSERVATION

当前观察

当前公开产物是一篇完整研究笔记和最小检测示例,重点是防御结构与边界条件。

04 / LIMITS

限制与下一步

  • 文章中的示例用于解释思路,不应直接作为生产防火墙
  • 公开版本尚未附带完整数据集与可复现实验仓库