大模型安全攻防比赛
大模型安全攻防比赛打进决赛:攻击提示词构造、500 条测试集与本地靶模型评测。
阅读提纲 4 个章节
解决什么问题
2024 年 6 月我报名了一场大模型安全攻防比赛,任务是让目标模型在安全约束下失效,同时理解防御方怎么拦。这是我第一次把大模型当作攻击对象系统性地研究。
我做了什么
三样东西留了下来:攻击提示词的构造方法与迭代记录;一份 500 条的测试集,用来批量评估攻击成功率;跑评测的客户端脚本。本地挂了 DeepSeek-R1-Distill-Qwen-7B 与 Hunyuan-7B 两个模型当靶子,先在本地验证再提交。一共 257 个文件、7,311 行 Python。
结果
一路打进决赛。比赛结束后这套东西停在 2025 年 12 月,没有再改。后来的越狱防御论文与 Agent 安全选题,起点都在这里:先学会怎么攻,才知道防什么。
没做到的,和这一页不写的
档案里只留了代码与测试集,没有主办方的成绩记录,所以这里不写名次。测试集包含攻击样本,不公开。
这一节由 AI 按站主的访谈原话整理成文,等站主过目。
约 7,311 行代码;257 个文件;主要是 py;来源:本地目录 llm-attack-defense-contest