大模型安全防护的常见误区 大模型安全防护的常见误区讨论大模型安全Prompt 注入、越狱攻击与防御评估实践时常见反模式、失败案例与修正方式常被写成一串工具或原则读完仍不知道该先检查什么。更实用的起点是把当前任务限定下来提示词、检索内容和工具返回值都可能是不可信输入。本文只谈可在授权范围内复核的做法。反模式先还原输入如何越界把涉及的对象列成清单不可信文本、工具权限、模型输出和外部数据源。对每项补上来源、修改者、依赖关系和失败后的影响。这里不追求面面俱到先选一条真实流程才能分清哪些观察是事实哪些只是猜测。围绕“常见反模式、失败案例与修正方式”安排工作第一类反模式是把不可信输入直接交给高权限组件处理。修正方式是先做结构校验、权限判断和最小化转换再决定是否执行。第二类反模式是用全局开关掩盖局部问题。更稳妥的做法是限定影响范围保留审计并为临时绕过设置到期时间。第三类反模式是只记录成功路径。测试和监控应覆盖拒绝、超时、降级和恢复才能验证系统在压力下仍按设计工作。留下能复查的记录记录至少应包含本次范围与授权前提、输入或样本的来源、环境和版本、预期结果、实际观察以及下一步由谁处理。还要核对模型是否被允许调用工具以及调用参数是否经过校验。对于大模型安全Prompt 注入、越狱攻击与防御评估实践可保留的证据包括策略决策、工具调用记录、拒绝原因与脱敏后的请求关联标识。防住一种提示不等于防住注入不应把模型生成的文字直接当作执行指令。如果材料不足结论可以停在“尚待验证”把未知项列出来比用概括性的成功或失败更诚实。下一次变更时沿用同一份记录即可判断原来的前提是否还成立。