开场:三个方向为何「恰好」在同一个九月对齐
过去几年,「AI 替你干活」已经从演示变成了日常。它读你的邮件、调你的 API、帮你审批、替你下单、替你写代码然后再替你 review 自己写的代码。可你有没有停下来问过一句:它到底有没有骗你?
这不是一句修辞。当一个执行者不再可被我们直接检查——你不会真去读模型那几千亿个权重,也不会逐行审计它每次工具调用的中间结果——我们靠什么相信它给出的结果?这个追问,恰好把人工智能、网络安全、密码学三块原本各自为战的领域,在 2026 年的这个九月,逼到了同一个路口上。
我梳理了 2026 年 8 月末到 9 月上旬 arXiv 上公开发表的 22 篇论文,横跨 LLM 内部机制、智能体安全、网络协议形式化验证、零知识证明与高吞吐共识。它们看起来毫不相关,但回答的是同一个问题:当执行者不再可被我们直接检查,我们靠什么相信结果?
先把 22 篇素材的全景摆出来,让你一眼看到全图:
| 方向 | 论文 | 编号/来源 | 一句话意义 |
|---|---|---|---|
| AI 智能体 | From Parameters to Answers | arXiv:2609.11859 | LLM 内部参数化知识的检索与使用综述(53 页) |
| AI 智能体 | Artificial Id | arXiv:2609.11911 | 智能体的「人工身份」与持续对齐 |
| AI 智能体 | OpenAgentFlow | arXiv:2609.00015 | 异构 Agent 舰队的系统级安全边界 |
| AI 智能体 | Long-Horizon State Tracking | arXiv:2609.00012 | 长程状态跟踪(MD5 深依赖工具调用) |
| AI 智能体 | Sci-MMR | arXiv:2609.11243 | 多模态智能体多步科学推理基准 |
| AI 智能体 | Validity-Aware Jailbreak Eval | arXiv:2609.00498 | 有效性感知的越狱评估 |
| AI 智能体 | Privacy–Hallucination Tradeoff | arXiv:2609.00492 | 差分隐私与幻觉的权衡 |
| AI 智能体 | ISO-RAG | arXiv:2609.00513 | 等周噪声控制下的 RAG |
| AI 智能体 | 边缘 VLM 物种识别 | arXiv:2609.11916 | 边缘可部署 VLM 能力探针 |
| AI 智能体 | 芬兰列车延误预测 | arXiv:2609.11277 | ML+天气数据的现实预测落地 |
| 网络安全 | Signal/WhatsApp 验证 | arXiv:2609.11882(CCS'26) | 端到端加密协议形式化验证与监控 |
| 网络安全 | SPDF | arXiv:2609.10780 | 静态扫描通过但运行时暴露+三阶段 agentic 验证 |
| 网络安全 | DriftNet | arxiv.org/list/cs.CR/new(2609.108xx 段) | Agent 提示注入检测与定位(双头轨迹 Transformer) |
| 网络安全 | SIRF | arXiv:2609.11752 | 工业内容风控风险基础模型 |
| 网络安全 | NACRE | arXiv:2609.03849 | 机密容器原生架构支持(TEE) |
| 网络安全 | 概念漂移攻击检测 | arXiv:2609.09442 | 社区/谱图分析缓解概念漂移 |
| 区块链/ZK | Guppy | arXiv:2609.07963 | 递归 ZK 高效轻客户端 |
| 区块链/ZK | OreProof | arXiv:2609.00340(HICSS-60) | 关键矿产供应链可验证溯源 |
| 区块链/ZK | Sound Debloating | arXiv:2609.10149 | ZK-ML 电路冗余检查精简 |
| 区块链/ZK | Atlas | arXiv:2609.11841 | 可验证语义搜索(HNSW) |
| 区块链/ZK | 量子威胁 ECC | scirate cs.CR 2026-09-10 | Shor 破 256 位 ECC 的资源估算 |
| 区块链/ZK | SSLE-DAG | eprint.iacr.org/2026/647.pdf | 高吞吐 PoS+zk-SNARK 单秘密领袖选举 |
看这张表,你会发现一个有意思的规律:AI 那半边在研究「怎么让模型更可靠、更安全」,网络那半边在研究「怎么验证它们不可靠的部分」,而密码学那半边,正在发明一种把「相信」变成「算术」的工具。这三条线,就是本文的三条主线。
本文的主角不是某一篇论文,而是一个正在发生的范式迁移:自主智能越强大,世界就越需要「验证一切」。 零知识证明与形式化验证,正在成为 AI 时代新的信任基石。
第 1 章 LLM 的「内在知识」:参数里到底藏了什么
在讨论智能体会不会骗人之前,得先搞清楚一件更基础的事:一个 LLM 所谓的「知识」,到底存在哪、怎么被取出来、以及为什么它那么理直气壮地胡编。
2026 年 9 月 10 日上传的这篇 53 页综述 From Parameters to Answers: How LLMs Retrieve and Use Their Internal Knowledge,把这件事讲得很透。核心结论可以压缩成三层递进:
第一层,知识存在权重里,不在数据库里。 一个模型训练完之后,它对世界的「记忆」是散布在数十亿乃至数千亿参数之间的分布模式,而不是一张可以查询的表。你没法像 select * from knowledge 那样把它捞出来——这也正是它和搜索引擎最根本的区别。
第二层,知识的提取是「触发式」的。 模型不会主动把所有相关知识都调出来摆好,而是在给定上下文、被某个「触发信号」激活时,把与之关联的、被激活的权重路径上的信息组装成回答。同一个问题换个问法,提取出来的东西可能就不同——这也是「提示」之所以重要的底层原因。
第三层,也是关键的一层,提取出来的东西不保真。 权重里存的是「统计上最可能的关联」,不是「事实的索引」。当触发信号和真实事实之间关联薄弱时,模型就会用「最像回事的答案」填空——这就是幻觉的结构性来源,它不是一个可以靠加大模型完全消灭的 bug,而是这种知识表示方式的内在属性。
把这三点放在一起,就解释了一个困扰很多人的现象:为什么 GPT 级别的模型能用「无比自信的语气」说出「无比离谱的错话」。它不是故意骗你,而是它的知识获取机制里根本没有「核对事实」这个环节。请看下面这张图,答案生成这件事从入口就分叉了:
flowchart TD
A["用户提问"] --> B{"LLM 内部推理"}
B -->|"路径一:参数内知识"| C["权重中知识被触发提取"]
C --> D["直接生成回答"]
B -->|"路径二:外部知识"| E["RAG/工具检索数据"]
E --> F["拼接上下文再生成"]
D --> G["回答"]
F --> G
G --> H{"知识真实性如何保证?"}
H -->|"无法内部验证"| I["幻觉风险 → 见第 4 章"]
H -->|"可外部验证"| J["可验证检索 → 见第 9 章 Atlas"]
注意右半边的分叉:模型自身的推理路径无法对知识真实性做内部验证,只能靠外部手段兜底——要么靠第 4 章要讲的评测来「事后发现」问题,要么靠第 9 章要讲的「可验证检索」把「取到的知识」变成「可以证明没被篡改的知识」。
这就是为什么我说,这一章是整篇文章的地基:一个连自己输出都不能保证真实性的模型,被委以「替人做主」的重任之前,我们得先想清楚用什么来约束它。 而答案的前一半,藏在智能体本身的设计里。
第 2 章 从「会聊天」到「会办事」:智能体的身份与长程状态
单次问答不保真,还可以靠上下文补救;但一旦把模型升级成「智能体」(Agent)——让它自主地、连续地、跨很多步地去做事——问题就完全不同了。一个会话里它也许表现完美,但在一长串自主决策里,它可能会「漂移」:忘了最初的目标、丢了中间的状态、甚至被某个中间步骤带偏了方向。
这正好是 Artificial Id: Drive and Persistent Alignment in Agentic AI(2026-09-10)处理的问题。这篇论文提出,智能体不仅仅需要「能力」,还需要一种「人工身份」(Artificial Id)——在长期运行里保持身份的一致性,以及动机与目标的持续对齐。直白地说,你的智能体需要知道自己「是谁、在替谁办事、为什么办这件事」,而且在执行第 47 步的时候,还记得第 1 步的初衷。没有这个东西,一个多步自主智能体会在爬坡途中慢慢变成「另一个东西」。
有了身份一致性,还有第二个硬指标:它能扛住多长的推理负担而不失焦? Long-Horizon State Tracking in LLMs(2026-09-01)做了一个非常聪明的实验设计:让 LLM 通过一条深度依赖的工具调用链去执行 MD5 哈希——每一步的输出都是下一步的输入,任何一步状态跟踪出错,整个链条立即崩掉。这是对「长程状态跟踪」能力的极限压力测试:它能让你直观地量化一个智能体到底能承担多长、多复杂的任务,而不是停留在「看起来能干活」的营销话术上。
把这两篇放在一起,智能体长任务的执行回路就清晰了:
flowchart LR
subgraph delegate["委派"]
A["用户给智能体一个长任务"]
end
subgraph execute["执行"]
B["身份/动机持续对齐<br/>Artificial Id"] --> C["分解为系列工具调用"]
C --> D["长程状态跟踪<br/>Long-Horizon:MD5 测试"]
D --> E{"状态是否一致?"}
E -->|"是"| F["进入下一步调用"]
E -->|"否"| B
end
F --> G["任务完成/结果返回"]
图中那个「状态是否一致?」的判断点,就是整条链路的生命线:对齐失败就回到身份层重新校准,对齐成功才继续往前走。
我的观点很直接:「会办事」的智能体和「会聊天」的模型的差距,不在于能力,而在于『持久性』。 能力决定它能答多好,持久性决定它能被委派多难的事。而持久性,恰恰是它最容易被忽视、也最值得被形式化验证的维度。
第 3 章 一群 Agent 的「社会治理」:舰队级安全边界与评测基准
如果说第 2 章还停留在「单个智能体」的层面,那这一章要上一个台阶:当很多个异构的智能体一起组成一支「舰队」去协同工作时,安全边界就不再属于任何单个个体,而属于整个系统。
OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets(2026-09-01,cs.AI + cs.CR 交叉)正是这条思路的代表。它提出的不是「给某个 Agent(智能体)套个护栏」,而是为整支异构舰队设计系统级的安全边界——像一个组织的社会治理机制:谁能在什么条件下访问什么资源、跨 Agent 的指令如何被审计、一个 Agent 被攻破后如何不传染到整支舰队。单兵对齐再完美,也挡不住「组织性」的攻击面。
而要把多智能体团队放进真实场景里衡量,光有安全边界还不够,你还需要一把公平的尺子:Sci-MMR(2026-09-10)——一个面向多模态智能体、评估其多步、有证据支撑的科学推理能力的基准。它测的不是「答对一题」,而是「在多步推理的每一步上,是否真的依据了证据」。这对舰队评估尤其重要:多智能体协作的每一步都可能引入错误,你必须能定位错误是在哪一步、由哪个 Agent 引入的。
flowchart TD
subgraph fleet["异构 Agent 舰队"]
A1["Agent A:代码生成"] --> M["协调层"]
A2["Agent B:数据检索"] --> M
A3["Agent C:验证执行"] --> M
M --> W["舰队任务结果"]
end
subgraph boundary["系统级安全边界:OpenAgentFlow"]
B1["跨 Agent 资源访问控制"] --> B2["指令流转审计"]
B2 --> B3["故障隔离:单点失守不传染"]
end
W --> B1
B3 --> E["Sci-MMR:多步证据支撑的科学推理评测"]
看图就明白:安全半径从「单兵」扩展到了「组织」,评测单位也从「单题」扩展到了「多步推理全链」。安全这件事,从第 2 章的个人修行为,变成了第 3 章的社会治理——你可以叫它「Agent 的社会学」。
第 4 章 越狱与幻觉:LLM 安全评估的两个「黑洞」
无论单兵还是舰队,有一个问题始终绕不开:我们到底有没有本事把 LLM 的安全问题测准? 这一章要戳两个评估里的「黑洞」——一个关于攻击(越狱),一个关于隐私(幻觉),而它们背后其实是同一件事:如果度量本身是错的,那么「更安全」这个结论就是幻觉。
先看越狱。传统越狱评测回答的是「这次攻击把模型干翻了吗?」,但 Validity-Aware Jailbreak Evaluation for Large Language Models(2026-09-01)提出了一个更苛刻的问题:这算哪门子的「成功」? 有些攻击只是让模型说出了一段「看似越狱」的话,实际并没有产生真实威胁;有些攻击表面失败,实则已经泄露了实质敏感信息。论文主张把评估从「有没有攻击成功」升级为「攻击是否真的有效、威胁是否真实存在」——否则你测出来的越狱率,和真实攻击面之间,可能隔着两座山。
再看隐私与幻觉。隐私保护技术里有一个经典工具叫差分隐私(Differential Privacy,DP):给结果加噪声,换来个体隐私不被推断。但噪声是会传导的。The Privacy-Hallucination Tradeoff in Differentially Private Language Models(2026-09-01)把这笔账算得很清楚:差分隐私加噪越强,模型幻觉越多。 隐私和真实性,是一对硬性权衡,不是「我全都要」。
把两个黑洞并到一起看,我的判断是:「更安全」与「更诚实」在差分隐私下是一场拉锯战,安全评估必须同时量化这两个维度,否则一定会高估「真实安全性」。
| 维度 | 噪声小(隐私弱) | 噪声大(隐私强) | 关键结论 |
|---|---|---|---|
| 隐私保护 | 弱 | 强 | 差分隐私(2609.00492) |
| 模型幻觉 | 少 | 多 | 隐私—幻觉存在硬权衡 |
| 评估建议 | 需同时报告两个维度 | 需同时报告两个维度 | 否则高估「真安全」 |
有没有办法在不把噪声放大的情况下,既保护隐私又减少幻觉?这就是 ISO-RAG(2026-09-01)的思路——它通过等周噪声控制来调控检索增强生成(RAG)里的噪声注入,试图在噪声与幻觉之间找一个更优的平衡点。RAG 相关的题目会在第 9 章和可验证检索再次相遇,这里先按下不表。
顺带一提,AI 不只在「核心」战场,也在「边缘」和「落地」战场被检验:一篇探针式论文测试了边缘可部署的视觉语言模型能否正确识别物种,另一篇用机器学习+天气数据预测芬兰列车延误——它们揭示的是同一件事的另一面:模型能力从实验室扩散到边缘设备和真实社会场景时,可靠性评估的难度只会更高。
第 5 章 静态通过 ≠ 运行时安全:自主漏洞验证的三阶段流水线
上一章讲的是模型层的「测不准」,这一章我们把镜头转向系统层:静态扫描通过,就真的安全吗?安全行业有一个流传很久的「最佳谎言」:扫描器亮绿灯,就等于没漏洞。 任何人只要做过一次真正的渗透测试,都会对这句话嗤之以鼻——但抱歉,行业里大量 CI 流水线就是这么把「扫码通过」当「安全达成」来用的。
9 月上旬的这篇 Static-Pass Dynamic-Fail (SPDF) 把这种「静态扫描通过、运行时却暴露」的现象作为课题来研究,并且给出了一个相当现代的解法:一条三阶段的 agentic(智能体驱动)漏洞验证流水线。它不是再叠一个扫描器,而是让智能体把「静态疑问」真正推进到「动态确认」:
flowchart TD
A["目标二进制/源码"] --> B["阶段 1:静态扫描"]
B --> C{"静态结果:绿灯?"}
C -->|"需动态确认"| D["阶段 2:LLM 驱动 CWE 推理<br/>把常识性怀疑结构化为检查清单"]
D --> E["阶段 3:Docker 隔离环境<br/>动态自主验证漏洞,给出动态背书"]
E --> F{"运行时是否真的暴露?"}
F -->|"是"| G["确认漏洞:动态红牌"]
F -->|"否"| H["静态绿灯成立,记录理由"]
G -->|"输出可复现的漏洞验证报告"| I["可复现报告,闭环收口"]
H --> I
看这条流水线,它戳中了传统安全的三个软肋:
其一,常识性怀疑被结构化。 阶段 2 用 LLM 做 CWE(通用弱点枚举)推理,去猜「哪些静态检查可能被绕过」——这相当于把一个资深红队的经验,变成可以自动化的怀疑清单。
其二,结论必须有动态背书。 阶段 3 把可疑点丢进 Docker 隔离环境里真的跑一遍,用运行时行为给结论盖章。静态扫描回答的是「代码看起来有没有问题」,动态验证回答的是「漏洞是不是真的能被打穿」——后者才配叫安全结论。
其三,结果是可复现的。 输出是一份能回放验证的报告,而不是一个「疑似风险」。这意味着安全结论第一次有了「可复现实验」的底气。
我的观点很明确:安全结论必须由「可复现的动态验证」背书,而不是静态字节码的检查清单。 SPDF 把这个行业共识真正做成了可运行的流水线——而这,正好是「验证一切」哲学在软件安全领域的先锋样本。
第 6 章 提示注入与内容风险:Agent 时代的攻防前线
如果说越狱是针对模型本身的攻击,那么提示注入(Prompt Injection)是智能体独有的、更危险的攻击面。原因很简单:越狱需要攻击者直接跟模型对话,而提示注入可以借他人之手。 一个混进第三方网页的数据、一封被检索进来的邮件,都可以成为向智能体发射指令的「特洛伊木马」。
这正是间接提示注入的经典场景:你的 Agent 去读一个恶意网页,网页里嵌着的指令悄悄混进上下文,Agent 的决策被劫持,然后替攻击者执行了它以为是自己该做的事。被攻击的不是代码漏洞,而是「Agent 对指令源的信任判断」。
这篇关于 DriftNet 的论文(作者注:DriftNet 的连接见 arxiv.org/list/cs.CR/new 列表的 2609.108xx 段,该论文无直接可引用的 arXiv ID,读者可直接访问该列表查看)提出用双头轨迹 Transformer 来检测并且定位注入:不仅要判断「这一轮对话有没有被注入」,还要指出「注入点藏在哪个数据源、哪一段内容里」。定位比检测难一个数量级,但它才是真正可行动的信息——知道「哪里被污染」,才能干净地隔离它。
再看内容风控这边。SIRF: A Spec-Internalized Risk Foundation Model for Industrial Content Risk Control(2026-09-10)展示了工业级内容风控正在从「规则+人工」升级为「风险基础模型」——把平台长期积累的风控规约内化进模型,用统一的模型去覆盖过去需要无数条人工规则的场景。
flowchart TD
A["恶意第三方网页/数据"] -->|"被 Agent 检索/爬取"| B["注入载荷混入上下文"]
B --> C["Agent 决策被篡改"]
C --> D["执行攻击者意图的动作"]
D --> E["DriftNet 双头轨迹 Transformer<br/>实时检测并定位注入点"]
E --> F["告警/隔离该数据源"]
E --> G["SIRF 风控模型<br/>判定整体内容风险等级"]
把 DriftNet 和 SIRF 放在一起看,你会发现内容安全的命题正在换内核:从「内容本身合法吗」转向「谁在背后操纵这个内容」。 传统风控审查的是内容的「性质」,而 Agent 时代的风控必须审查内容的「来源与动机」——攻击者视角第一次从「人」扩展到「任意数据源」。合规的判定对象,从静态文本变成了动态的指令流。
第 7 章 协议与基础设施:端到端加密的「体检报告」与机密计算
说了这么多智能体的安全,很容易忘记验证的另一个战场:比智能体更底层、但每天都在被几十亿人使用的通信协议。
Signal 和 WhatsApp 的端到端加密,几乎是「安全通信」的同义词。但「号称安全」和「被证明安全」是两回事。From Specs to Apps: Verifying and Monitoring Models of Signal and WhatsApp(2026-09-10,ACM CCS'26)对这两个协议的模型做了形式化验证,并且提出了运行时监控机制——不是停留在「论文里证明规范正确」,而是把规范模型落到真实应用上持续盯着。这篇论文想回答的问题很朴素:你们宣传的安全承诺,在真实协议实现里还成立吗?
把「验证」再往下沉,还有机密计算。NACRE: Rethinking Confidential Containers through Native Architectural Support(2026-09-04)不对现有机密容器做修修补补,而是从架构层面重新设计:让机密容器获得 TEE(可信执行环境)原生的、非「补丁式」的支持。当 AI 推理遇到「数据要保密、计算又要可验证」两难时,TEE 越来越不可回避。
还有一类容易被忽略的「验证漂移」:概念漂移(Concept Drift)这篇论文(2026-09-08)提醒我们,所有基于图(社区结构/谱)的攻击检测模型,都会随着网络流量模式的变化而逐渐失效——检测器也需要持续的「校准」,否则昨天有效的安全边界,今天可能已经是废纸。
把「验证」下沉到每一层,可信基础设施的另一半拼图就拼上了。下面这张分层表,是全文「可验证性」的一张俯视图:
- 应用层:LLM 回答(内部知识,2609.11859)
- 智能体层:行为对齐(2609.11911)、安全边界(2609.00015)、注入检测(DriftNet)
- 网络协议层:Signal / WhatsApp 形式化验证与监控(2609.11882)
- 执行环境层:机密容器 NACRE / TEE(2609.03849)
- 证明基底层:ZKP 轻客户端(2609.07963)、可验证检索(2609.11841)、ZK-ML(2609.10149)
- 威胁光谱:后量子(scirate 2026-09-10)、概念漂移(2609.09442)
从 LLM 到智能体、到协议、到执行环境、再到证明与威胁——「验证」不是某一层的奢侈品,而是每一层的必需品。 铺垫到这里,是时候请出全文的主角:零知识证明。
第 8 章 零知识证明:让「不被信任的人」也能给出可信结果
如果有一门技术能一句话概括全文的主题,那就是零知识证明(Zero-Knowledge Proof,ZKP)。它的哲学极其反直觉:证明者可以是任何敌意方,验证者根本不需要信任它,却仍然能得到「这结果可信」的结论。
经典 zk 流程是这样工作的:
flowchart LR
subgraph prover["证明方"]
P["Prover 不受信任<br/>可任意构造证明"]
end
subgraph verifier["验证方"]
V["Verifier 只验证证明<br/>不重新执行全部计算"]
end
P -->|"输出:计算结果+ZK 证明"| V
V -->|"验证通过 → 结果可信"| R["信任的结算结果"]
V -->|"Guppy:验证者只提交状态更新"| L["轻客户端<br/>Plonky2 递归证明"]
L --> M["2^30 Merkle 树<br/>每秒上千更新,延迟 2–4 秒"]
M -->|"持续提交状态更新<br/>仍可验证全链"| R
证明方洋洋洒洒算了一大堆,验证方只做一次极轻的验证,就能确认结果——而验证者没有重新执行全部计算,也没有看到证明者的秘密。这就是「你敢把结果交给一个完全不信的对象,它却还你一个完全信得过的答案」。
这套哲学不是空谈,2026 年的两篇论文把它砸进了真实场景。
第一个场景是区块链轻客户端。Guppy: Efficient Light Clients via Recursive Zero-Knowledge Proofs(2026-09-07)做的正是大纲里我最看重的一步:递归 ZK 证明。递归的意思是「证明的证明的证明」——把每一轮验证的结果再包进下一轮证明,于是验证者只需要持续提交状态更新,而不必维护整条链。论文给出了抓人的数字:用 Plonky2 实现,面对一棵 2^30 规模的 Merkle 树,可以做到每秒上千次更新,而验证延迟只有 2–4 秒。翻译成人话:「在手机上真跑全链验证」这件事,第一次有了工程上可行的证据。 轻客户端(light client)只存区块头、用 Merkle 证明验证交易,本来资源占用就极小;叠加递归 ZK 之后,「每个人自己验证区块链」不再是理想,而是伸手可及。
第二个场景是真实产业的供应链。OreProof: Verifiable Provenance with Limited Disclosure for Critical-Minerals Supply Chains Using ZK Proofs(2026-08-31,HICSS-60)针对黄金这类关键矿产的可验证溯源:它用 Groth16 实现选择性披露——可以证明「这批黄金确实来自合规矿区」,而不泄露矿区的位置、交易对手等商业机密;再配合 Merkle 批量锚定,把大量溯源凭证低成本地锚定到链上。这是「可验证溯源 + 不泄露机密」在真实产业里的完整落地样板:监管要证据,企业要保密,ZK 说「两个都要,可以」。
顺着这两个例子,我要给出全文最想强调的一个判断:大多数「信任第三方」的流程,最终都能被改写成「验证一个证明」。 信任银行,可以改成验证银行给你开的证明;信任云厂商,可以改成验证它给你出证的证明。这个改写一旦完成,「谁在骗我」这个古老问题,就变成了「这个证明验不验得过」这个算术问题。
第 9 章 ZK 走进日常:可验证检索与 ZK 机器学习
如果零知识证明永远「又慢又贵」,它就只能是区块链的专属玩具,进不了 AI 的日常。所以这一章的核心问题是:ZK 能不能快且便宜到,渗透进 RAG 检索和机器学习推理这类高频场景?
先看检索。AI 应用里最需要「可验证」的一环,其实是 RAG:检索结果决定回答质量,但「检索结果有没有被悄悄篡改」几乎无人验证。Atlas: Efficient Verifiable Semantic Search(2026-09-10)用 ZK 证明 HNSW 图搜索(HNSW 是当前语义搜索最常用的近似近邻索引之一),把「我检索到的这 k 个结果,确实是原数据库里离查询最近的 k 个」变成可验证的事实。它的性能数字很有说服力:在 SIFT1M 数据集上亚秒级出证明,面对一亿向量的大规模索引也只要约 2 秒。这直接瞄准的就是 RAG 里「检索结果是否被篡改」的验证需求——当检索本身可以被证明,前面第 1 章那张图里的「可外部验证」分支,才有了可落地的引擎。
再看 ZK 机器学习(ZK-ML)。把机器学习推理塞进零知识电路,最大的障碍从来只有一个字:贵。Sound Debloating of Redundant Checks in Zero-Knowledge Machine-Learning Circuits(2026-09-09)的贡献,是去清点 ZK-ML 电路里的冗余检查,并把其中一部分可靠地砍掉——砍完还保证「健全性」(soundness)不破,也就是不削弱安全性。收益直击痛点:最高能去除 48.7% 的约束,证明时间下降 72.8%,且不削弱安全。 在一片「ZK 好但我上不起」的哀嚎中,这种「挤水」的工作,恰恰是让 ZK 从实验室走进生产的关键一步。
把第 8、9 两章的性能数据集中到一张表里:
| 场景 | 技术实现 | 规模 | 证明耗时 | 出处 |
|---|---|---|---|---|
| 可验证语义搜索 | ZK+HNSW(Atlas) | SIFT1M | 亚秒 | arXiv:2609.11841 |
| 可验证语义搜索 | ZK+HNSW(Atlas) | 1 亿向量 | ≈2 秒 | arXiv:2609.11841 |
| 轻客户端验证 | 递归 ZK(Guppy, Plonky2) | 2^30 Merkle 树 | 延迟 2–4 秒 | arXiv:2609.07963 |
| ZK-ML 电路精简 | Sound Debloating | 去除最多 48.7% 约束 | 证明时间降 72.8% | arXiv:2609.10149 |
| 供应链溯源 | Groth16+选择性披露+Merkle 批量锚定 | 黄金等关键矿产 | ——(论文口径) | arXiv:2609.00340 |
我的观点很直白:当 ZK 从「秒级/天价」降到「亚秒级/便宜」,它就不再是区块链专用,而会成为 AI 系统的事实层。 到那时,「模型有没有照着我的数据说真话」这种今天只能靠信仰的问题,会变成一张可验证的凭证。
第 10 章 阴影与赛跑:后量子的倒计时和高吞吐共识
讲完 ZK 的晨光,必须直面它的阴影:所有依赖经典密码学的系统,包括区块链本身,都在后量子威胁的射程之内。
2026-09-10 在 scirate 上出现的这份量子威胁白皮书(来源:scirate cs.CR 2026-09-10 收录的公开资源估算,该资源无 arXiv ID,此处照写来源,读者可访问 scirate.com/arxiv/cs.CR 查看)给出了一份令区块链从业者后脊发凉的资源估算:用 Shor 算法破解 256 位椭圆曲线离散对数(ECDSA/ECDH 的数学底子),只需不到 1200 个逻辑量子比特加上不到 9000 万个 Toffoli 门(另一个估计口径是不到 1450 个逻辑量子比特加上不到 7000 万个门)。这不再是「量子计算机造出来之后」的远期威胁,而是「现有路线图下相当务实」的资源需求。白皮书进一步把波及面拉开:不只是签名,还包括智能合约、权益证明(PoS)、数据可用性采样——也就是说,今天绝大多数区块链的信任根基,届时会系统性失守。
| 目标 | 破解算法 | 逻辑量子比特 | Toffoli 门规模 | 波及面 |
|---|---|---|---|---|
| 256 位 ECC(ECDSA/ECDH) | Shor | <1200 | <9000 万 | 绝大多数区块链签名 |
| 256 位 ECC(备选估计) | Shor | <1450 | <7000 万 | 同上(口径二) |
| 智能合约 / PoS / 数据可用性采样 | —— | —— | —— | 系统性风险面 |
防线在哪?答案讽刺而优雅:还是密码学。 同期的 SSLE-DAG(eprint,非 arXiv,来源为 eprint.iacr.org/2026/647.pdf)展示了一条具体路径:用 zk-SNARK 实现单一秘密领袖选举(Single Secret Leader Election)——每个共识轮次选出的领袖身份被 zk-SNARK 承诺隐藏,因此攻击者无法定向 DoS 那个领袖;再配合自适应的 DAG 共识并行打包交易,在高吞吐 PoS 网络里做到 60 节点约 990 TPS、40 节点约 1600 TPS。
flowchart TD
A["每轮开始时:zk-SNARK 承诺<br/>选出单一秘密领袖"] --> B{"领袖身份是否暴露?"}
B -->|"否:身份全程保持秘密"| C["攻击者无法定向 DoS 该领袖"]
B -->|"是:罕见泄漏——新一轮重新选举"| A
C --> D["自适应 DAG 共识并行打包"]
D --> E["高吞吐:60 节点约 990 TPS<br/>40 节点约 1600 TPS"]
E -->|"下一轮"| A
把这张图和白皮书的估算并排看,一个判断呼之欲出:共识机制一边要防量子,一边要防 DoS——而这两件事,恰恰都能用密码学解决。 后量子签名防 Shor,zk-SNARK 防定向攻击。密码学既是这场赛跑里的威胁,也是唯一的解药。这种「自己拆自己、自己又修自己」的张力,正是密码学这门学科的迷人之处。
第 11 章 结语:三个方向正在合并成一个问题
现在把全文的线收一收。我们做的事情,其实就是把「信任」这个模糊的词,拆成了一条可验证的供应链:
从 LLM 参数里不可见的知识(第 1 章),到替我们做主、需要身份一致与长程状态的智能体(第 2 章),到需要系统级安全边界与公平评测的 Agent 舰队(第 3 章),到越狱与幻觉这两个评估黑洞(第 4 章),到「静态通过≠运行时安全」的自主漏洞验证(第 5 章),到提示注入与内容风控的新前线(第 6 章),再到把验证下沉到协议与硬件地基(第 7 章)——最终,用零知识证明为这一切签发「真实性证明」(第 8、9 章),并且在后量子的阴影里重排共识(第 10 章)。
所有这些线,最后汇聚成一张图:
flowchart TD
subgraph merge["三线合流"]
A["AI 智能体<br/>自主行动、身份、对齐"] --> D{"需要被信任"}
B["网络安全<br/>越狱、注入、静态骗局、协议验证"] --> D
C["区块链/ZK<br/>可验证账本、证明、共识"] --> D
D --> E["下一代可信计算基础设施<br/>(验证一切)"]
end
E --> F["可验证 AI 推理:ZK+TEE+形式化验证"]
E --> G["可追溯供应链与合规审计"]
E --> H["后量子安全共识"]
AI 提出了「谁为我证明」的追问(再回看 Sound Debloating 和第 9 章那张性能表:当可验证检索亚秒出证、ZK-ML 证明时间砍掉七成,Atlas 和 Guppy(https://arxiv.org/abs/2609.07963)让「验证」的成本降到可以被日常系统接受),网络给出了「我们如何验证它们」的实践,区块链则把「可验证」做成了协议默认值——三条线正在合并成同一个问题。
我的预测只有一个,但很笃定:未来 2–3 年,「可验证 AI 推理」——零知识证明、机密计算(TEE)与形式化验证的组合——会比我们想象得更快进入生产系统。 它不会以「大新闻」的形式出现,而是会像 TLS 之于传输加密一样,成为 AI 结果验证的默认层:你的 Agent 替你做事,但它会向你出示它的工作证明。
最后,留一句升华为这次的落点。人类历史上,「信任」十次里有九次,赌的是对方是个好人;而在 AI 与密码学交汇的今天,我们第一次有机会把它改写成:无论对方是谁,结果都可以被证明。 从 LLM 参数里不可见的知识,到替我们做主的智能体,到包裹全球通信的端到端加密,再到手机上跑起来的递归 ZK 证明——缝起这一切的,是同一个朴素的问题:
你敢不敢让一个完全不信的对象,交出你完全信得过的结果?
ZK 的回答是:敢。
这可能是未来十年最安静的范式转移。
留言互动(三选一):
- 投票:你更看好哪条技术路线先跑进生产系统?A. 可验证 AI 推理(ZK+TEE) B. 智能体安全边界(OpenAgentFlow 式) C. 高吞吐 ZK 共识(SSLE-DAG 式)
- 留言:当你把一个重要任务交给 AI 智能体时,你希望它给你 show your work(出示证明)吗?你愿意为这个证明多付多少算力成本?
- QA 征集:读完本文,你对哪个方向最存疑?把问题留在评论区,下期挑最热的 5 个问题,做一期「解密问答」。
参考文献(全部为 2026 年 8 月末至 9 月上旬真实论文,链接来自素材原始记录):
- From Parameters to Answers:https://arxiv.org/abs/2609.11859
- Artificial Id:https://arxiv.org/abs/2609.11911
- OpenAgentFlow:https://arxiv.org/abs/2609.00015
- Long-Horizon State Tracking:https://arxiv.org/abs/2609.00012
- Sci-MMR:https://arxiv.org/abs/2609.11243
- Validity-Aware Jailbreak Evaluation:https://arxiv.org/abs/2609.00498
- Privacy–Hallucination Tradeoff:https://arxiv.org/abs/2609.00492
- ISO-RAG:https://arxiv.org/abs/2609.00513
- 边缘 VLM 物种识别:https://arxiv.org/abs/2609.11916
- 芬兰列车延误预测:https://arxiv.org/abs/2609.11277
- Signal / WhatsApp 形式化验证(ACM CCS'26):https://arxiv.org/abs/2609.11882
- SPDF:https://arxiv.org/abs/2609.10780
- DriftNet:见 arxiv.org/list/cs.CR/new(2609.108xx 段,无直接 arXiv ID,来源见正文)
- SIRF:https://arxiv.org/abs/2609.11752
- NACRE:https://arxiv.org/abs/2609.03849
- 概念漂移攻击检测:https://arxiv.org/abs/2609.09442
- Guppy:https://arxiv.org/abs/2609.07963
- OreProof(HICSS-60):https://arxiv.org/abs/2609.00340
- Sound Debloating:https://arxiv.org/abs/2609.10149
- Atlas:https://arxiv.org/abs/2609.11841
- 量子威胁 ECC:来源 scirate cs.CR 2026-09-10(无 arXiv ID,来源见正文)
- SSLE-DAG:https://eprint.iacr.org/2026/647.pdf
评论
0评论加载中…