PentAGI 深扒:一套开源的「全自动 AI 渗透」系统,18K star 背后是什么
PentAGI 深扒:一套开源的「全自动 AI 渗透」系统,18K star 背后是什么
一条抖音把它包装成「俄罗斯网安巨头甩出的重磅炸弹」。剥掉营销壳子后,它其实是一个非常值得研究的 多智能体(multi-agent)自动化范式 样本——不管你做不做安全,它把「AI 自己规划、自己动手、自己纠错」这件事跑通到了产品级。这篇把项目核对清楚,再讲它真正值得借鉴的地方。
一、这条视频在讲什么
博主发了一条 28 秒的短视频,文案是「俄罗斯网安巨头甩出的开源AI项目」。逐字稿核心就几句:
网安圈又扔出重磅炸弹,俄罗斯顶级网安巨头直接开源了一整套 AI 自动渗透系统。它在开源平台已经拿下 18K 的 star,你只要给出测试目标,它会自动走完扫描、识别、分析工具的完整流程,遇到阻碍还会自主调整策略,整个逻辑跟专业人员做渗透完全一致,用来学习渗透思路特别合适。整个项目封装在 docker 容器里一键就能启动,内置 20 多种常用安全工具和知识库,不用挨个找资源装依赖。
视频画面里反复出现产品界面:左侧是任务流列表(Web App Vulnerability 一类的子任务),中间是 Agent 的对话/推理过程,右侧是 Terminal / Tasks / Agents / Searches / Vector Store / Screenshots 六个标签页。项目名在界面和文档里写得很清楚——PentAGI。
二、先核对:它到底是不是真的(不脑补)
短视频最爱「巨头 + 炸弹 + 重磅」这套话术,所以第一件事是去源头把事实钉死。核对结果:
| 视频说法 | 核对结论 |
|---|---|
| 项目名 | ✅ PentAGI,仓库 github.com/vxcontrol/pentagi |
| 18K star | ✅ 实测 18,043 star / 2,467 fork(数字对得上) |
| 开源、一键启动 | ✅ MIT 协议,Docker Compose 一键起,可完全自托管 |
| 内置 20+ 工具 | ✅ 默认 Kali Linux 镜像,含 nmap、Metasploit、sqlmap 等 20+ 工具 |
| 自主渗透、自己调整策略 | ✅ 多智能体自主编排,确实是「给目标→自己跑完」的设计 |
| 「俄罗斯网安巨头」 | ⚠️ 存疑,属于营销包装。见下 |
关于「俄罗斯巨头」这个点要说实话: 发布方叫 VXControl,GitHub 组织页登记地是阿联酋(UAE),官网 vxcontrol.com,是一家专注安全工具的小型团队,粉丝三百多。它不是卡巴斯基、也不是 Positive Technologies 那种真正意义上的「俄罗斯网安巨头」。权威媒体(Help Net Security、CyberSecurityNews)报道时只写「VXControl 出品」,没有任何一家确认它是俄罗斯大厂。所以「俄罗斯顶级网安巨头」是短视频为了抓眼球加的滤镜——项目是真的、能力是真的、但「巨头」二字是包装。这正好是一个提醒:爆款视频的定性词要自己去源头验,别当结论转发。
三、把 PentAGI 拆开看:它凭什么能「自己跑完渗透」
它不是「一个大模型硬刚」,而是一套分层的智能体协作系统。这套结构才是真正值得学的东西。
1)编排层:一个指挥官 + 三个专家(Orchestrator + 3 Specialists)
给它一个目标(比如「测这个 Web 站点有没有漏洞」),系统会把任务拆成 flows → tasks → subtasks → actions 的层级,由一个 Orchestrator(编排者) 统筹,下面挂三个分工明确的专家 Agent:
- Researcher(侦察员):搜集信息、查已知漏洞库(CVE 等),把「有哪些可能的攻击面」摸清楚。
- Developer(策略/开发):规划具体攻击路径、决定用什么工具、怎么组合。
- Executor(执行者):在隔离容器里真正敲命令、跑工具、拿回结果。
这就是它「遇到阻碍会自主调整策略」的来源——不是一个模型瞎试,而是侦察→规划→执行→回看→再规划的闭环在转。「一个编排者带一队专家、任务层层拆解」这套骨架,几乎适配任何复杂的自主 Agent 任务分工。
2)记忆层:三层记忆 + 可选知识图谱
Agent 最难的从来不是「会用工具」,是「记得住上下文、跨轮次不失忆」。PentAGI 用了三层:
- 长期记忆:向量存储(PostgreSQL + pgvector),语义检索历史经验。
- 工作记忆:当前任务的实时上下文。
- 情景记忆(episodic):过程历史,知道「刚才试过什么、结果如何」。
- 可选 Neo4j 知识图谱:跨会话存实体之间的语义关系(哪个主机连哪个服务、哪个漏洞挂哪个组件)。
这是整篇最该抄的一点:一个能长期干活的 Agent,记忆不能只靠「把历史全塞进 prompt」,得分层——热的放工作记忆、冷的进向量库、关系型的进图谱。
3)沙箱层:Docker 全隔离,工具即装即用
所有真实操作都在独立 Docker 容器里跑,默认 Kali 镜像,20+ 安全工具开箱即用。好处有二:① 安全隔离,AI 乱敲不会伤到宿主;② 交付门槛极低——docker compose up 一条命令,别人不用挨个装依赖就能复现整套环境。最低配置只要 2 vCPU / 4GB 内存 / 20GB 磁盘。
4)模型层:不绑单一厂商
支持 OpenAI、Anthropic(Claude)、Google Gemini、AWS Bedrock、Ollama(本地)、DeepSeek、OpenRouter 等一堆 provider。想用云端大模型也行、想用本地 Ollama 省钱/保密也行——避免被单一模型厂商锁死,这也是工程上很成熟的设计。
一句话总结架构
PentAGI = 分层任务编排(1指挥+3专家)+ 三层记忆(向量/工作/情景)+ Docker 沙箱工具箱 + 多模型可插拔。 安全只是它的应用场景,真正硬核的是这套「让 AI 长期、自主、可复现地干活」的工程范式。
四、值得借鉴的通用做法(可抄清单)
不管你是做安全、做运维、还是做任意「让 AI 自主完成一件复杂事」的产品,这六点都可以直接迁移:
- 编排结构:一个 Orchestrator 拆
flows→tasks→subtasks→actions,下挂「侦察 / 规划 / 执行」三类专家 Agent —— 复杂任务分工的通用模板,别把所有活丢给单个 agent。 - 记忆分层:长期(向量库)+ 工作(当前上下文)+ 情景(过程历史)+ 可选知识图谱 —— 治 Agent「失忆」的标准方案,别指望超长 prompt 记住一切。
- Docker 一键复现:Compose 封装 + 预装工具箱,
up一条命令交付 —— 让任何工具类产物「开箱即跑」,把复现门槛降到最低。 - 多模型可插拔:抽象一层 provider,云端/本地随意切 —— 不被单一厂商锁死,兼顾成本与隐私。
- 执行进沙箱:让 AI 自主跑命令前,先关进隔离容器 —— 这是所有「自主执行类」产品的安全底线。
- 信息鉴别的方法:面对「大厂/巨头 + 开源 + AI + 炸裂能力」这类高传播力的定性,一律回到源头(官方仓库 + 权威媒体)交叉核实再下结论 —— 这次的「俄罗斯巨头」就是一个被放大的滤镜。
从趋势看:它标记了什么
PentAGI 能把「渗透测试」这种需要长链条推理 + 真实工具操作 + 动态纠错的硬核专业活,用 Agent 跑到产品级、还拿下 18K star,说明一件事:AI Agent 正在从「聊天 / 写作」跨进「自主执行专业操作」的深水区。安全只是第一批,接下来会蔓延到运维、数据分析、法律检索、财务审计等一切「专业但流程化」的领域。而多智能体编排、Agent 长期记忆工程、沙箱化执行这三样,是所有「自主 Agent」的公共底座——现在练熟,就是在为下一波卡位。
五、一句话收尾
PentAGI 表面是个「AI 自动渗透工具」,剥开看是一份**「怎么让 AI 长期、自主、可复现地干专业活」的工程范本**。它的营销词有水分(不是什么俄罗斯巨头),但它的架构是真金——编排分层、记忆分层、执行沙箱、模型可插拔,这四样才是真正值得带走的东西。
项目地址:
github.com/vxcontrol/pentagi(MIT,18K star)。仅供学习安全防御与 Agent 工程研究,渗透测试请在授权范围内进行。