首页文章

文章

全部技术文章,按发布时间倒序排列

标签 可信度量· 共 1清除筛选
09142026金秋 · 收获

原创它能干,但可信吗?——从 14 篇 arXiv 新论文看懂智能体评测、审计与治理的集体爆发

AI 智能体越来越能干:替你读邮件、调 API、审批、下单,甚至替你写代码再替你 review。可一个每天替你办事的执行者,你凭什么相信它没在骗你?2026 年 9 月第一周,arXiv 上扎堆出现 14 篇论文,把『智能体可不可信』从一句口头追问,变成了一门可以测量、可以审计、可以治理的工程。本文承接上篇『谁在证明它没骗你』的全景,切入纵深:诡计行为的压力测试基准(SchemeArena)与风险感知评测(AURA-Eval)、全生命周期信任分(AgentAudit)、步级注入标注数据集(AgentDrift)与威胁分级(TIER);再向上走到机制可组合的合约治理(CONTINUITY)、推理时治理与多智能体联邦治理(Beyond Training / PRIMUS)、区块链锚定的可审计证据(Black Box for Agentic Processes);最后落到 TEE 混淆搜索、后量子加速器、MEV 韧性与波动共识等底层地基。结论先行:能力评估的时代正在过去,『可信度量』的时代正在开始——检测粒度、治理边界与证据可验证性,将一起决定 Agent 到底能被委以多大事。