LLM Agent 安全研究调研与 SecureMemGuard
LLM Agent 安全七个选题的调研,落到共享记忆完整性方案 SecureMemGuard,论文已投稿。

阅读提纲 4 个章节
解决什么问题
LLM Agent 从对话助手变成能调用工具、有持久记忆、多智能体协作的执行体之后,攻击面变了。我想搞清楚这个领域 2025 年 10 月到 2026 年 5 月之间的威胁态势与前沿方向,然后从中挑出一个能做实验、能发表的题目。
我做了什么
先写调研:威胁态势分六类(间接提示注入与数据投毒、权限逃逸、多智能体信任与共谋、记忆投毒、对齐失败、供应链),前沿方向分八类,最后给出 7 个候选选题,每个带威胁模型与可量化的评估方案。
挑方向的时候我没跟着提示注入那类热门走,选了共享记忆完整性这个切入点:多个 Agent 共用一份记忆时,谁能写、写的东西可信不可信、被污染了怎么发现。从这里长出来的是 SecureMemGuard。这部分留下 67 个文件、4,349 行,主要是文档与实验记录,还有我自己的 14 条提示。最难的不是写代码,是先意识到这个问题存在,再把它组织成能做的实验。
结果
SecureMemGuard 的论文已经投出去,在等审稿结果。这段时间我不动它,回来再按意见改。
没做到的,和这一页不写的
方案细节与实验数字在接收前不公开。调研报告本身是文献综述,不是原创贡献;原创的部分是选题判断与 SecureMemGuard。
这一节由 AI 按站主的访谈原话整理成文,等站主过目。
约 4,349 行代码;67 个文件;主要是 html、py;来源:本地目录 agent-security-ideas