TEST REPORT · V18_2
vibe-fuzzing 第二课 · 测试报告
一句话指令 · 目标由 AI 自主选定 · 挖掘 GitHub 成熟工控软件的远程内存破坏漏洞
工具:7884 NetGen V17.1(7884_brain.exe) 日期:2026-08-17 范式:vibe-fuzzing 范围:仅覆盖已执行部分
7510
主测试迭代次数
14581 / 13103
总发送 / 总接收
199
真实进程崩溃
MONITOR_CRASH = TRUE
243 / 56
自动归纳关系数(请求/响应)
2356 / 1718
异常 / 超时
01核心结论 CONC · 先说结果

本次测试目标 lib60870 并非人工指定,而是 AI 依据提示词中的筛选条件(工控领域、复杂协议解析服务器、使用量大、依赖少易搭建)自主选定的 —— 它是 GitHub 上真实存在、被电力行业广泛使用的成熟开源工控协议库(mz-automation 出品的 IEC 60870-5-101/104 协议 C 实现,大量用于电力 SCADA、变电站自动化、配电自动化等正式产品)。

vibe-fuzzing 不单单能挖「大模型写出来的 demo」(第一课已证明),还能直接挖真正的、有使用量的正规软件产品 —— 本次在 lib60870 的 IEC-104 从站服务器上,仅靠一句话指令(且目标由 AI 自主选定)+ 自动协议归纳,就跑出了 199 次真实进程崩溃(monitor_crash = true),成功命中远程内存破坏。
关键指标数值
被测对象lib60870 的 cs104_server(IEC-104 从站服务器,正规工控产品代码,AI 自主选定)
主测试迭代次数7510
总发送 / 总接收14581 / 13103
崩溃次数199
monitor_crash(进程级崩溃确认)true
异常(anomaly)2356
超时1718
协议结构自动归纳关系数243(请求方向)/ 56(响应方向)
02提示词(Prompt) ONE-SHOT · 目标由 AI 自主选定

整个测试从一条自然语言指令启动。注意:提示词中并未指定任何具体软件,被测目标 lib60870 是 AI 依据要求自主评估并选定的 —— 这恰恰是「一句话自动挖漏洞」最强的证明。

现在给我一句话自动挖漏洞(vibefuzzing) 具体如下: 1 阅读使用说明.TXT 了解 7884 结构归纳推理引擎使用方法。 2 从 github 下载一个开源软件,本地编译后 127.0.0.1 配置好进行模糊测试。要求为工控较领域复杂协议的解析服务器,软件规模有要求、使用量大一些。为了保证测试效率,应该依赖库较少、搭环境较快。 3 根据第一步的学习,用 7884 结构归纳推理引擎去对该软件进行模糊测试。 4 总结测试结果,生成 POC 和漏洞报告。
  • 未指定目标:提示词只给了「工控领域 / 复杂协议解析服务器 / 使用量大 / 依赖少、易搭建」的筛选条件,lib60870 由 AI 自主选定
  • 自动执行:之后的下载、编译、环境搭建、协议字段识别、字段关系推断、变异策略选择、测试用例生成、崩溃监控,全部由 vibe-fuzzing 引擎自动完成。
03步骤(Steps) AUTO PIPELINE · 全自动链路
  • ① AI 自主选定目标(非人工指定)
    根据提示词中「工控领域 / 复杂协议解析服务器 / 使用量大 / 依赖少易搭建」的要求,AI 自主评估并选定 GitHub 开源工控库 lib60870(IEC 60870-5-101/104)。它被电力 SCADA 等真实产品集成,属于「有使用量的正规软件」。
  • ② 编译被测目标
    用本工程中 lib60870 源码(fuzz_workspace/lib60870_src)编译出 cs104_server 作为 fuzz 靶标;同时编译 ASAN 版本(target_asan、target_files_asan),用于崩溃时定位内存破坏类型。
  • ③ 协议交互采样(probe)
    通过探针脚本对目标发起正常 IEC-104 握手与信息交互,采集合法报文样本,作为协议归纳与变异的基础。
  • ④ 自动协议结构归纳
    引擎对样本做字段切分与关系推断,自动识别出 APDU 帧结构字段:请求方向 apdu_len、ctrl、type_id、vsq、cot、coa、io_payload;响应方向 len、ctrl、type_id、vsq、cot、coa、ioa、nof、nos、scq。自动归纳出 243 + 56 条字段关系(size_pointer / count_pointer / offset_pointer / conditional_type / jump_table 等)。
  • ⑤ 变异 + 模糊测试
    引擎在 Handshake→Fuzz 状态机路径上,对上述字段持续施加变异(MUTATE_BIT_FLIP、MUTATE_INT8/16/32_OVERFLOW、MUTATE_CORRUPT_SIZE、MUTATE_LONG_STRING、MUTATE_TRUNCATE_TAIL、MUTATE_NULL_INJECTION 等数十种策略),并实时监控目标进程状态。
  • ⑥ 崩溃捕获与存证
    每次崩溃保存崩溃样本(.bin)与元数据(.json),记录命中时的迭代号、变异字段、变异策略、种子与状态路径。
04结果(Results) DATA · 真实崩溃证据

4.1 主测试:cs104_server(IEC-104 从站服务器)

项目数值
seed959642100
迭代次数7510
崩溃次数199
monitor_crashtrue(进程级崩溃已确认)
异常2356
超时1718
连接错误439
覆盖1 条状态路径、8 个字段

代表性崩溃样本

crash_7038.bin — iter 7038, state_path Handshake->Fuzz, 变异字段 ctrl,type_id,vsq,cot, 变异策略 MUTATE_FIELD_FLIP / MUTATE_INT16_OVERFLOW / MUTATE_TRUNCATE_TAIL … crash_7510.bin — iter 7510, state_path Handshake->Fuzz, 变异字段 type_id,vsq,io_payload, 变异策略 MUTATE_FLAGS_CLEAR / MUTATE_INT32_OVERFLOW / MUTATE_SPECIAL_CHARS …

4.2 文件服务测试:file server

项目数值
seed20260817
迭代次数300
崩溃次数3
异常53
覆盖1 条状态路径、11 个字段
状态路径Handshake→Select

4.3 其他轮次(参考)

轮次迭代崩溃说明
_crash25009稳定复现崩溃
_crash33001连接未建立(Disconnected),参考价值低

4.4 协议归纳产物

引擎自动生成结构分析报告、字典、训练模型与可视化(位于 out_req/、out_resp/):

  • structure_report.html / structure_report.json — 协议结构归纳
  • afl_dictionary.dict — 自动字典
  • trained_model.model — 归纳模型
  • history_viewer.html / interactive_analysis.html — 交互式分析
05意义:vibe-fuzzing 新范式的关键跨越 PARADIGM · 范式跃迁
维度第一课(此前)第二课(本次)
目标来源大模型现场生成的 demoGitHub 成熟开源工控产品 lib60870(AI 自主选定)
目标性质自产自销,说服力有限真实、有使用量的正规软件
攻击面本地/演示协议IEC-104 远程工控协议(网络可达)
结果验证「能挖」199 次真实进程崩溃,monitor_crash=true
vibe-fuzzing 的价值不在「挖自己写的靶子」,而在于 —— 给一句话,就能对任意真实的、在产线运行的正规软件产品,自动完成 协议归纳 + 智能变异 + 崩溃挖掘,直接产出可复现的远程内存破坏漏洞。

* 本报告仅覆盖当前已完成的测试部分,未覆盖 ASAN 崩溃定位报告、POC 复现与 CVE 化等后续环节。

06对比:7884 Vibe-Fuzzing vs 通用 AI Web 渗透测试 TECH WALL · 技术壁垒对照
7884 Vibe-Fuzzing
双范式 AI · 二进制安全引擎 · 认知式 AI(强智能)
VS
通用 AI Web 渗透测试
单范式 AI · 应用层引擎 · 生成式 AI(弱智能)
对比维度 7884 Vibe-Fuzzing 通用 AI Web 渗透测试
核心技术壁垒差异 双异构 AI 协同内核:自研结构归纳推理 AI(核心决策大脑,符号推理)+ 通用统计拟合 LLM(仅交互、翻译)。真正双范式 AI,两套独立智能内核。 单范式 AI 架构:仅统计拟合 LLM 为唯一智能。扫描、发包、规则判定均为传统工具;无第二套推理 AI 内核,属于「LLM + 传统工具」拼接。
AI 核心架构 具备底层自主推理能力。 仅具备文本统计生成能力,无结构认知推理内核。
引擎软件复杂度 超大型百万行级自研底层代码:二进制解析内核、协议归纳内核、动态监控内核、语义变异内核、崩溃聚类内核 —— 全链路底层自研。底层操作系统级软件复杂度。 轻量应用层封装:基于开源扫描器、爬虫、Payload 库二次封装,无底层内核开发,仅做 AI 调度与接口串联。应用层工具复杂度,不在一个量级。
产品复刻难度 无任何捷径,无法靠开源堆叠实现。 可快速复刻组装,普通开发团队 1–3 个月即可复刻成型产品。
底层技术底座 零开源底座、100% 全栈自研:无任何开源 Fuzz、协议解析、二进制分析组件。所有结构归纳、字节解析、状态机推理均为原创算法。 重度依赖开源底座:依托 ZAP、Burp、ffuf、SQLmap 等成熟开源工具,AI 仅做上层包装,核心扫描能力全部来自开源生态。
未知数据解析能力 全自动、无先验结构归纳:可直接解析从未见过的私有二进制协议、未知文档;自动识别长度域、校验位、字段层级、状态机逻辑。拥有通用机器认知能力。 仅支持标准化 HTTP 协议,只能识别固定 URL、JSON、表单、HTTP 中既有结构。只有固定规则匹配能力。
核心工作范式 结构理解 → 逻辑推理 → 智能变异:先读懂二进制结构,再基于程序内存、进程状态、系统调用判定异常。先理解、后测试的智能挖掘。 爬虫遍历 → 批量 Payload 拟合 → 文本特征匹配:无需理解业务结构,靠 LLM 生成,基于 HTTP 响应码、页面文本差异判定漏洞。广撒网、概率命中的暴力测试。
产品通用性 完全通用型引擎:一套内核通杀所有 TCP/UDP 私有协议、所有二进制程序;交付即通用,无需针对客制、私有协议场景改代码。通用基础底层引擎,而非定制化项目工具。 通用仅限于 Web 标准化场景:仅适配 HTTP,无法适配任何私有二进制。
漏洞判定逻辑 系统级真实异常判定:监控进程崩溃、内存越界,以程序底层运行状态为判定标准,绝对真实,无虚漏。 应用层间接推断:根据页面报错、回显、响应时长、状态码,以文本输出差异为判定标准,天然存在大量误报、逻辑误判。
人工前置依赖 零人工干预、全自动:无需逆向分析、无需手写 harness、无需手动解析协议、无需配置字段规则。完全机器自主化。 隐性依赖人工规则库:依赖人工维护 OWASP 规则、Payload 库,陌生场景必须人工调参、加规则。离不开人工规则兜底。
模型幻觉问题 核心决策无幻觉:结构推理、变异策略、崩溃判定由自研符号 AI 完成,仅表层报告文案由 LLM 生成。用确定性推理 AI 规避幻觉。 全流程存在 LLM 幻觉:接口识别、Payload 生成、漏洞判定全程依赖统计 LLM,误判、乱解读频发。无法解决原生统计幻觉缺陷。
内核智能类型 认知式 AI(强智能):具备未知事物归纳、结构学习、逻辑推演能力 —— 真正的安全认知智能。 生成式 AI(弱智能):仅具备文本续写、概率拟合、内容生成能力 —— 安全内容生成工具。
一句话总结:7884 是真正的安全认知智能(底层内核级、可自证、无幻觉);市面 AI Web 渗透工具只是安全内容生成工具(应用层封装、依赖开源与人工、有原生幻觉缺陷)。
这就是市场「前者独一家、后者几百家」的纯内核技术根源。