例行检查 / Checklist
Level 1 Fast-Path 长度阈值豁免:对字符数低于阈值(如 ≤300 字符)的日常低熵指令(如“继续”、“OK”、简短问答),直接绕过安全审计直通主号,零延迟、零 Token 开销放行 75%+ 的日常无风险流量;
Level 2 零盘化增量切片(Zero-Disk Slicing):长上下文基于 KV Cache 信任继承,仅在内存即时截取「System 设定 + 上轮末尾锚点 + 增量 User」送审,防止多轮渐进式催眠,同时避免小规格服务器的磁盘 I/O 损耗;
Level 3 推测式并发抢跑(Speculative Streaming):主号请求与 Guard 审计全链路异步并发下发,网关仅暂存主号首包数据(约 80ms~ 120ms 窗口)。审计通过立即 flush 并透传流;审计违规立即向主号下发 AbortController.abort() 强杀连接并返回 403,主号未吐出违规输出即终止,彻底避免上游风控标记;
Strike 记分卡惩戒:内存记录恶意触发违规次数,取代模糊防御,对蓄意越狱试探实行确定性清退。
应用场景 / Use Case
防止主号连坐封禁:在主号池化 API 中转与多租户网关中,部分用户的越狱与对抗性注入极易导致主号被官方风控标记甚至连带封号,必须加装前置 Guard;
消解前置审计带来的交互迟滞:目前同步串行审计机制会带来 200~ 400ms 的硬性延迟,高频短交互体感严重卡顿;
期望方案 / Desired Behavior
用户端体感零额外延迟:
短文本(≤300 字符)直通透传,首字延迟(TTFT)与无审计裸连完全一致;
长文本请求在主号思考期间并发完成审计,审计判定时间被完全并盖在主号 TTFT 内,用户感知不到审计阻碍。
主号确定性安全防护:
遭遇蓄意越狱注入时,客户端立即收到 403 阻断响应,主号上游连接在毫秒级被中断,主号不产生违规补全内容,上游账号不被标记。
确定性惩戒追踪:
触发阻断的用户累积 1 次 Strike,达到上限直接吊销 API Key。
兼容性、数据与安全影响 / Compatibility, Data, and Security Impact
API 与协议兼容性:完全兼容标准 OpenAI Chat Completions SSE 协议,不变更任何现有接口格式;
配置项扩展:仅需在环境配置中引入可选开关与阈值参数(如 GUARD_FAST_PATH_LIMIT=300、GUARD_SPECULATIVE=true),未配置时平滑降级;
数据与存储影响:N/A(所有增量差分切片与首包暂存均在内存中无盘化流转,不占用磁盘空间,不破坏现有数据库架构);
安全影响:正面收益,彻底消除下游越狱导致主号封号的单点风险。
备选方案 / Alternatives Considered
同步串行前置审计:每次请求必须等待 Guard 模型完整返回后再连接主号,用户端 TTFT 增加 200~ 400ms,高频短命令体感极差;
完全依赖上游平台内置安全机制:不做网关层防护,一旦出现恶意对抗提示词,主号面临直接降额、封禁等高额损失;
本地规则/Embedding 库静态过滤:对抗性越狱提示词具有高度混淆性与多语言变体,正则与本地相似度黑盒误报率高且无法应对复杂越狱。

例行检查 / Checklist
目标版本线 / Target Release Line2.x
功能描述 / Feature Description在网关层实现前置安全审计(Anti-Jailbreak Guard)的三级加速与推测式并发机制:
Level 1 Fast-Path 长度阈值豁免:对字符数低于阈值(如 ≤300 字符)的日常低熵指令(如“继续”、“OK”、简短问答),直接绕过安全审计直通主号,零延迟、零 Token 开销放行 75%+ 的日常无风险流量;
Level 2 零盘化增量切片(Zero-Disk Slicing):长上下文基于 KV Cache 信任继承,仅在内存即时截取「System 设定 + 上轮末尾锚点 + 增量 User」送审,防止多轮渐进式催眠,同时避免小规格服务器的磁盘 I/O 损耗;
Level 3 推测式并发抢跑(Speculative Streaming):主号请求与 Guard 审计全链路异步并发下发,网关仅暂存主号首包数据(约 80ms~ 120ms 窗口)。审计通过立即 flush 并透传流;审计违规立即向主号下发 AbortController.abort() 强杀连接并返回 403,主号未吐出违规输出即终止,彻底避免上游风控标记;
Strike 记分卡惩戒:内存记录恶意触发违规次数,取代模糊防御,对蓄意越狱试探实行确定性清退。
应用场景 / Use Case
防止主号连坐封禁:在主号池化 API 中转与多租户网关中,部分用户的越狱与对抗性注入极易导致主号被官方风控标记甚至连带封号,必须加装前置 Guard;
消解前置审计带来的交互迟滞:目前同步串行审计机制会带来 200~ 400ms 的硬性延迟,高频短交互体感严重卡顿;
期望方案 / Desired Behavior
用户端体感零额外延迟:
短文本(≤300 字符)直通透传,首字延迟(TTFT)与无审计裸连完全一致;
长文本请求在主号思考期间并发完成审计,审计判定时间被完全并盖在主号 TTFT 内,用户感知不到审计阻碍。
主号确定性安全防护:
遭遇蓄意越狱注入时,客户端立即收到 403 阻断响应,主号上游连接在毫秒级被中断,主号不产生违规补全内容,上游账号不被标记。
确定性惩戒追踪:
触发阻断的用户累积 1 次 Strike,达到上限直接吊销 API Key。
兼容性、数据与安全影响 / Compatibility, Data, and Security Impact
API 与协议兼容性:完全兼容标准 OpenAI Chat Completions SSE 协议,不变更任何现有接口格式;
配置项扩展:仅需在环境配置中引入可选开关与阈值参数(如 GUARD_FAST_PATH_LIMIT=300、GUARD_SPECULATIVE=true),未配置时平滑降级;
数据与存储影响:N/A(所有增量差分切片与首包暂存均在内存中无盘化流转,不占用磁盘空间,不破坏现有数据库架构);
安全影响:正面收益,彻底消除下游越狱导致主号封号的单点风险。
备选方案 / Alternatives Considered

同步串行前置审计:每次请求必须等待 Guard 模型完整返回后再连接主号,用户端 TTFT 增加 200~ 400ms,高频短命令体感极差;
完全依赖上游平台内置安全机制:不做网关层防护,一旦出现恶意对抗提示词,主号面临直接降额、封禁等高额损失;
本地规则/Embedding 库静态过滤:对抗性越狱提示词具有高度混淆性与多语言变体,正则与本地相似度黑盒误报率高且无法应对复杂越狱。