跳到正文
已结束,进入决赛主线 · 研究毕业与入学之间

大模型安全攻防比赛

大模型安全攻防比赛打进决赛:攻击提示词构造、500 条测试集与本地靶模型评测。

阅读提纲 4 个章节

解决什么问题

2024 年 6 月我报名了一场大模型安全攻防比赛,任务是让目标模型在安全约束下失效,同时理解防御方怎么拦。这是我第一次把大模型当作攻击对象系统性地研究。

我做了什么

三样东西留了下来:攻击提示词的构造方法与迭代记录;一份 500 条的测试集,用来批量评估攻击成功率;跑评测的客户端脚本。本地挂了 DeepSeek-R1-Distill-Qwen-7B 与 Hunyuan-7B 两个模型当靶子,先在本地验证再提交。一共 257 个文件、7,311 行 Python。

结果

一路打进决赛。比赛结束后这套东西停在 2025 年 12 月,没有再改。后来的越狱防御论文与 Agent 安全选题,起点都在这里:先学会怎么攻,才知道防什么。

没做到的,和这一页不写的

档案里只留了代码与测试集,没有主办方的成绩记录,所以这里不写名次。测试集包含攻击样本,不公开。

这一节由 AI 按站主的访谈原话整理成文,等站主过目。

约 7,311 行代码;257 个文件;主要是 py;来源:本地目录 llm-attack-defense-contest