DCEB:确定性上下文嵌入的越狱防御
用确定性上下文嵌入防御大模型越狱:两次顶会被拒后继续返修,改投 NDSS'27。
阅读提纲 4 个章节
解决什么问题
大模型的越狱攻击:用精心构造的上下文绕过模型的安全对齐。我做的方法叫 DCEB,确定性上下文嵌入(Deterministic Context Embedding),思路是在上下文表示层做防御,而不是只靠提示词过滤。
我做了什么
2026 年 2 月开题。工作量主要在三块:复现并跑通一批 baseline 防御方法做对照;构造实验,让不同攻击在同一套设定下比较;两轮审稿后的返修材料。目录里有 5,779 个文件、约七万行 Python 与 Shell 脚本,其中 104 份 Markdown 是实验记录与返修笔记。
结果
论文先投 USENIX Security ’26,未中;改投 CCS ’26,被拒;现在按两轮审稿意见返修,改投 NDSS ’27。被拒两次是事实,方法本身我还在改,最后一次改动是 2026 年 7 月 17 日。
没做到的,和这一页不写的
论文在审稿期间,方法细节、实验数字与审稿意见不在这里公开,接收后补论文链接与代码。这一页能证明的是:这个题目我从 2026 年 2 月做到现在,经历过完整的投稿与返修周期。
这一节由 AI 按站主的访谈原话整理成文,等站主过目。
约 70,978 行代码;5,779 个文件;主要是 py、sh;来源:本地目录 dceb-jailbreak-defense