本次测试目标 lib60870 并非人工指定,而是 AI 依据提示词中的筛选条件(工控领域、复杂协议解析服务器、使用量大、依赖少易搭建)自主选定的 —— 它是 GitHub 上真实存在、被电力行业广泛使用的成熟开源工控协议库(mz-automation 出品的 IEC 60870-5-101/104 协议 C 实现,大量用于电力 SCADA、变电站自动化、配电自动化等正式产品)。
| 关键指标 | 数值 |
|---|---|
| 被测对象 | lib60870 的 cs104_server(IEC-104 从站服务器,正规工控产品代码,AI 自主选定) |
| 主测试迭代次数 | 7510 |
| 总发送 / 总接收 | 14581 / 13103 |
| 崩溃次数 | 199 |
| monitor_crash(进程级崩溃确认) | true |
| 异常(anomaly) | 2356 |
| 超时 | 1718 |
| 协议结构自动归纳关系数 | 243(请求方向)/ 56(响应方向) |
整个测试从一条自然语言指令启动。注意:提示词中并未指定任何具体软件,被测目标 lib60870 是 AI 依据要求自主评估并选定的 —— 这恰恰是「一句话自动挖漏洞」最强的证明。
4.1 主测试:cs104_server(IEC-104 从站服务器)
| 项目 | 数值 |
|---|---|
| seed | 959642100 |
| 迭代次数 | 7510 |
| 崩溃次数 | 199 |
| monitor_crash | true(进程级崩溃已确认) |
| 异常 | 2356 |
| 超时 | 1718 |
| 连接错误 | 439 |
| 覆盖 | 1 条状态路径、8 个字段 |
代表性崩溃样本
4.2 文件服务测试:file server
| 项目 | 数值 |
|---|---|
| seed | 20260817 |
| 迭代次数 | 300 |
| 崩溃次数 | 3 |
| 异常 | 53 |
| 覆盖 | 1 条状态路径、11 个字段 |
| 状态路径 | Handshake→Select |
4.3 其他轮次(参考)
| 轮次 | 迭代 | 崩溃 | 说明 |
|---|---|---|---|
| _crash2 | 500 | 9 | 稳定复现崩溃 |
| _crash3 | 300 | 1 | 连接未建立(Disconnected),参考价值低 |
4.4 协议归纳产物
引擎自动生成结构分析报告、字典、训练模型与可视化(位于 out_req/、out_resp/):
| 维度 | 第一课(此前) | 第二课(本次) |
|---|---|---|
| 目标来源 | 大模型现场生成的 demo | GitHub 成熟开源工控产品 lib60870(AI 自主选定) |
| 目标性质 | 自产自销,说服力有限 | 真实、有使用量的正规软件 |
| 攻击面 | 本地/演示协议 | IEC-104 远程工控协议(网络可达) |
| 结果 | 验证「能挖」 | 199 次真实进程崩溃,monitor_crash=true |
* 本报告仅覆盖当前已完成的测试部分,未覆盖 ASAN 崩溃定位报告、POC 复现与 CVE 化等后续环节。
| 对比维度 | 7884 Vibe-Fuzzing | 通用 AI Web 渗透测试 |
|---|---|---|
| 核心技术壁垒差异 | 双异构 AI 协同内核:自研结构归纳推理 AI(核心决策大脑,符号推理)+ 通用统计拟合 LLM(仅交互、翻译)。真正双范式 AI,两套独立智能内核。 | 单范式 AI 架构:仅统计拟合 LLM 为唯一智能。扫描、发包、规则判定均为传统工具;无第二套推理 AI 内核,属于「LLM + 传统工具」拼接。 |
| AI 核心架构 | 具备底层自主推理能力。 | 仅具备文本统计生成能力,无结构认知推理内核。 |
| 引擎软件复杂度 | 超大型百万行级自研底层代码:二进制解析内核、协议归纳内核、动态监控内核、语义变异内核、崩溃聚类内核 —— 全链路底层自研。底层操作系统级软件复杂度。 | 轻量应用层封装:基于开源扫描器、爬虫、Payload 库二次封装,无底层内核开发,仅做 AI 调度与接口串联。应用层工具复杂度,不在一个量级。 |
| 产品复刻难度 | 无任何捷径,无法靠开源堆叠实现。 | 可快速复刻组装,普通开发团队 1–3 个月即可复刻成型产品。 |
| 底层技术底座 | 零开源底座、100% 全栈自研:无任何开源 Fuzz、协议解析、二进制分析组件。所有结构归纳、字节解析、状态机推理均为原创算法。 | 重度依赖开源底座:依托 ZAP、Burp、ffuf、SQLmap 等成熟开源工具,AI 仅做上层包装,核心扫描能力全部来自开源生态。 |
| 未知数据解析能力 | 全自动、无先验结构归纳:可直接解析从未见过的私有二进制协议、未知文档;自动识别长度域、校验位、字段层级、状态机逻辑。拥有通用机器认知能力。 | 仅支持标准化 HTTP 协议,只能识别固定 URL、JSON、表单、HTTP 中既有结构。只有固定规则匹配能力。 |
| 核心工作范式 | 结构理解 → 逻辑推理 → 智能变异:先读懂二进制结构,再基于程序内存、进程状态、系统调用判定异常。先理解、后测试的智能挖掘。 | 爬虫遍历 → 批量 Payload 拟合 → 文本特征匹配:无需理解业务结构,靠 LLM 生成,基于 HTTP 响应码、页面文本差异判定漏洞。广撒网、概率命中的暴力测试。 |
| 产品通用性 | 完全通用型引擎:一套内核通杀所有 TCP/UDP 私有协议、所有二进制程序;交付即通用,无需针对客制、私有协议场景改代码。通用基础底层引擎,而非定制化项目工具。 | 通用仅限于 Web 标准化场景:仅适配 HTTP,无法适配任何私有二进制。 |
| 漏洞判定逻辑 | 系统级真实异常判定:监控进程崩溃、内存越界,以程序底层运行状态为判定标准,绝对真实,无虚漏。 | 应用层间接推断:根据页面报错、回显、响应时长、状态码,以文本输出差异为判定标准,天然存在大量误报、逻辑误判。 |
| 人工前置依赖 | 零人工干预、全自动:无需逆向分析、无需手写 harness、无需手动解析协议、无需配置字段规则。完全机器自主化。 | 隐性依赖人工规则库:依赖人工维护 OWASP 规则、Payload 库,陌生场景必须人工调参、加规则。离不开人工规则兜底。 |
| 模型幻觉问题 | 核心决策无幻觉:结构推理、变异策略、崩溃判定由自研符号 AI 完成,仅表层报告文案由 LLM 生成。用确定性推理 AI 规避幻觉。 | 全流程存在 LLM 幻觉:接口识别、Payload 生成、漏洞判定全程依赖统计 LLM,误判、乱解读频发。无法解决原生统计幻觉缺陷。 |
| 内核智能类型 | 认知式 AI(强智能):具备未知事物归纳、结构学习、逻辑推演能力 —— 真正的安全认知智能。 | 生成式 AI(弱智能):仅具备文本续写、概率拟合、内容生成能力 —— 安全内容生成工具。 |