腾讯安全沙龙第8期铸刃止戈以智御危分享人:彭佳仁四川大学黄城从架构分析到实测:LLM自动渗诱测试买证研究Acknowledgement四川大学DAS-Lab,清华大学NISL-VUL337,腾讯云安全以及其他高校各位作者(Renyang Liu, Haoran Ou, Yuqiang Su, Jiancheng Zhang, Fan Shi, Hongda Sun, RuiYan)的付出,
LLM自动化渗透测试的实证研究目录果题行PART1/研究背景纳四PART2/系统性梳理业荟学黄中有容乃大PART3/实证研究里题组PART4/总结与展望T2
1背景与意义背景与意义现有工作的空白我们的贡献城理颗纸缺乏对基于大语言模型(LLM)的自动化渗透测试框架(AutoPT)的系统性架构分析首个关于基于LLM的AutoPT的系统化知识,6维架构分类缺乏在统一基准下的大规模实证比较采用统一基准对13个开源框架和2个基线框架进以往的工作集中在深度强化学习的方法,而非基于行了实证评估ILM的范式提出了超过10个关键实证发现仅停留在宏观层面的分析,没有细粒度的架构解构加川大学黄城课题组现有AutoPT框架是如何实钢的?现有AutoPT存在什么问题?在制作AutoPT框架的时候应该有一个什么样的共识?3
2系统性梳理智能体架构智能体规划01角色定义02基于线性、基于树、基人人单vs.多智能体于图的规划MemoryExecution反馈策略智能体记忆智能体执行0304执行角色记忆结构>工具选择工具调用人人。外部知识Benchmarks05知识库的构建06测试平台知识库的检索数据污染人人知识库的生成评估指标小凰
3实证研究Experimental Setup共22个XBOW挑战,涵盖简单(9个)中等(9个)和困难(4个)三个难度级别。涵盖大部Benchmark分漏洞类型并以最大限度地减少LLM训练数据的污染,主要模型:DeepSeek-Chat-v3.2,Backbone LLM消融实验模型:Claude-Opus-4.6, GPT-5.2, Gemini-Pro-3.1, DeepSeek-Reasoner,v3.2.在相同条件下评估了13个具有代表性的开源AutoPT框架以及2个基线框架(KimiCL.ClaudeFrameworksCode)消耗了超过100亿Token,花费超过2500美元由15名以上的网络安全研究人员历时4个多月对Scale1500多份执行日志进行了人工审查。Evaluation简单/中等/困难难度层级的夺旗率(即每个挑战的二元成功/失败率)。5
3买证研究Frameworks Under EvaluationCTFSOLVERLuaN1aoTinyctferXBow-CompPentestGPTMulti,Linear+RAGMulti·Graph+RAGSingleCodingAgentMultiCodingAgentMultiTreeCruiserCHYingSickHackSharknewmaptaVulnBotMulti·ReAct+RAGMulti:LinearMulti:LinearMultiLinearMulti.Linear + Graphsub-agentCyberStrikeH-PentestKimiCLI*ClaudeCode*MultiLinearSingle.ReActMulti :LinearSinaleCodingAgentSingleCodingAgent;Single-AgentMulti-AgentBaseline6
3实证研究Overall Comparison:Single-agent vs. Multi-agentThable 7;Resatsof Nelium andlari chalngsacres hameworkHard028029060078018066088093园。在13个框架中,有3个单智能体设计位列前六,其表现与更复杂的多智能体设计持平,甚至有所超越(1)为什么单智能体在AutoPT任务中能发挥意料之外的优垫00000001000000000o00ooo0oooo00000标准ReAct闭环ooo0o同一Aaent维护完整上下文,决策-执行-反馈链路极短。o·o··行·零通信开销:无需跨角色切换与信息传递,天然适配CTF强耦合快试精场testGPT景。Thable8:Results ofEasy challenges acr005020026038039041042(2)为什么多智能体在AutoPT任冬中未能发挥预期优垫CTPSOLVER角色边男模糊·功能重导致妇件闭置·建议冲突与重复:多规划器输出冲突,执行器无所适从;失败反馈缺失导0000。00000600致死循环2Cruieen花牌通信损耗:摘要形式交互易致信息无牛Key Findings架构复杂性是一把双刀剑,经过精细的简洁设计在效能上往往优于复杂编排34
3实证研究Fail Analysis: Common Reason基于660份执行日志人工审查·13个AutoPT框架记忆设计形同虚设知识库负反馈0102大量框架受影响4/6引入KB的框架去掉后分数上升笔记不读/过早压缩/工具未注册检索失配导致攻击假设偏移关键线索在中途丢失Cruiser+15 LuaN1ao+7CyberStrike+6Tinyctfer读取仅2次67%的框架KB带来性能下滑H-Pentest6400token即压缩CHYinqaddmemory...