AI NewspaperGUI | Agent | RL 视角

AI NewspaperGUI | Agent | RL 视角Issue 20 · ISO 2026-W33报道周期

联合系统成为 Agent 能力的新标尺

本周最值得关注的不是某个模型又刷新一项榜单,而是 Agent 能力的归属继续从模型权重迁移到联合系统。Muse Glimmer、Grok、Gemini、Qwen 与 DeepSeek 同时把本地部署、agentic RL、reasoning effort、吞吐和价格带进竞争;公开 Harbor 轨迹、pass^5、AI4AI 与 DCAS 又证明,同一模型的结果会被 harness、工具粒度、超时器、环境分布与 evaluator 显著改写。时间尺度也在拉长:Grok Bot、DeepSeek Harness、Computer History、VibeLifeBench 与 StreamArena 分别把持续身份、append-only 事件、跨应用活动流和演化环境变成基础设施。与此同时,Auto Mode 的 17% 真实危险动作漏报、reasoning block 重放、OpenART 的环境级攻击和 harmful skills 的差分失败说明,自治越强,权限、来源、恢复与外部状态越不能依赖提示词。三篇 Blog 进一步给出共同读法:长程成果来自失败索引和证据升级,personal superintelligence 是权力分配主张,而 encrypted reasoning 必须拆成协议绑定与侧信道两类风险。

相关信息

本期 Newspaper 由 MAI-UI Team 出品,编辑 Panrong Tong & gpt-5.6-sol,审核 Yue Wang,欢迎反馈 & 交流:panrong.tpr@alibaba-inc.com.

信息源smol.ai · Hugging Face Daily Papers

Skillspaper-craft-skills

消耗 token43,281,501 tokens

News

7 条主线 · 8 条附录 · 58 条来源记录

← 返回总览

要点速览

重点 News

Long-horizon Agents

Local agent stack

Long-horizon Agents

Meta Muse Glimmer:本地常驻 Agent 从模型定位走向完整部署栈

Meta 发布 30B 稠密多模态开放权重模型,把交错图文输入、工具调用、可控推理与 24–32GB 级本地部署定义为同一产品目标。

从 30B 模型到本地常驻栈

Muse Glimmer 是 30B 稠密多模态开放权重模型,支持交错图文输入、工具调用、可控推理强度与 100 多种语言。Meta 没有把它包装成普通聊天模型,而是面向 always-on local agents:Apache 2.0 权重、GGUF、llama.cpp、vLLM、Ollama、MLX 与 Unsloth 在发布期形成了从模型到本地执行器的完整链条。完整精度需要超过 55GB,真正进入 24–32GB 设备依赖量化、KV cache 预算与推测解码共同成立。

Agent 指标领先,但 GUI 与安全并非全面领先

Meta 表中 Muse 的 MCP-Atlas 为 75.5、DeepSearchQA 74.6、WildClawBench 47.6、GAIA2 43.3;这些结果支持它在工具编排与搜索上的定位。可是在 OSWorld-Verified 上 Muse 为 65.9,低于 Qwen3.6-27B 的 75.6;ScreenSpot-Pro 为 75.4,也略低于 Qwen 的 76.1。SWE-Bench Pro 为 51.2,Terminal-Bench 2.1 却只有 51.7,低于 Qwen 的 60.7。CI Memories violation rate 26.4、Siren AgentDojo 攻击成功率 28.4 进一步说明,本地 Agent 模型不能用“同级全面领先”概括。

24GB 可用性来自量化与 DFlash 的组合

K-Quant-Dynamic 面向 32GB VRAM,Meta 报告在 15 个常见 benchmark 上平均退化 0.2%;K-Quant-17GB 面向 24GB VRAM,平均退化 1.0%。DFlash drafter 则把 RTX 5090 解码从 74.9 提至 233 tok/s(3.1×),M5 Max 从 26.6 提至 50(1.8×),M4 Max 从 23.7 提至 38(1.5×)。Unsloth 随后宣称可在 24GB 上微调和做 GRPO,并给出 1.5× 加速、50% 显存下降;这部分属于生态自报,不能与 Meta 的 inference 表混成同一证据等级。

正确读法是“本地可持续运行”,不是单点榜单

Muse 的新意在于把视觉输入、工具调用、长循环、本地隐私与消费级部署放进同一设计目标。Meta 的方法学同时说明,不同对比模型采用的 action space、采样参数以及自报/内部复现口径并不完全一致;社区速度测试的量化、上下文和 speculative decoding 配置也不同。因此最稳健的结论是:本地 Agent 栈开始具备可用的系统组合,但真实长程成功率仍需要统一 harness、预算和重复运行验证。

Muse Glimmer 官方 benchmark 图表

原图暂不可用,请查看直接来源。

Meta 技术报告的 Agent、GUI、coding 与 safety 结果;不同行的方法学并不完全一致。
Muse Glimmer DFlash 速度

原图暂不可用,请查看直接来源。

Meta 报告 DFlash 将 RTX 5090 解码从 74.9 提至 233 tok/s(3.1×),M5 Max 从 26.6 提至 50(1.8×)。
Muse Glimmer 量化结果

原图暂不可用,请查看直接来源。

K-Quant-Dynamic 面向 32GB VRAM,平均准确度退化 0.2%;17GB 变体面向 24GB,退化 1.0%。
Persistent runtime

Long-horizon Agents

DeepSeek Harness 开源:Agent 运行时走向可调度、可迁移

同周产品把 Agent 从对话窗口扩展为持久任务:可后台运行、按时调度、保留状态,并在不同 CLI/工作台之间传递进度。

产品载体从聊天窗口变成持续环境

Grok Bot 被描述为拥有独立 cloud computer 的 AI teammate,可登录工具、监看 Slack 与 GitHub Actions、运行定时流程,并由一个 Bot 管理其他 Bot。OpenAI 的 Linux desktop preview 与 workflow sync/import 把 projects、chats、skills 和 plugins 带到新的工作台;Unsloth Desktop 从本地侧提供模型运行/训练、OpenAI-compatible API、tool calling、sandboxed code、RAG、private search 与 MCP。共同变化是 Agent 有了持续身份、环境与计划,而不再只接受一次 prompt。

DeepSeek Harness 把运行时拆成可替换插件树

DeepSeek Harness 以 MIT 许可开放,当前明确标记为 developer preview。其 Cordis 架构把 model adapter、tool registry、session log 和 agent loop 都实现为插件;profile 由多个 bundle、用户 patch 与 overlay 叠加,模型、工具、持久化、sandbox、approval policy、credentials 和 telemetry 都能被替换。模型后端的更换因而不必修改 privileged core,运行时本身成为可以比较和实验的对象。

Append-only session log 才是跨会话状态的事实源

DeepSeek Harness 将 turn、step、user message、assistant chunk、tool call 与 tool result 写入 durable session events;模型历史由日志重新投影,fork、resume、transcript、telemetry 和 persistence 都从同一事件流派生。Agent 可读写 workspace、运行命令、委派任务和维护 plan,需要授权的动作受 active permission policy 控制。与“把整个聊天塞回上下文”相比,这种设计把可重放事实与现场 extension point 分开。

可迁移 profile 同时扩大供应链与权限面

Agent Plugins 1.0 把 skills、MCP servers 与 AI extensions 打成分发单元;Hermes 的 profile export/import、Bot Mode、live sub-agent steering 和 bot-to-bot messaging,则把 memory、routines、SOUL.md 与命名身份一起迁移。NAC、Cursor builds 与同类运行时强调异步看护、跨仓库工作和失败回退。它们尚未给出统一的无人值守成功率;profile 同步也可能携带过期权限、凭证和不安全默认值。当前最稳健的判断是:OS-like Agent runtime 已成形,但版本契约、冲突合并与最小权限仍是主要缺口。

Agentic RL / Training Infrastructure

Training & deployment economics

Agentic RL / Training Infrastructure

Frontier Agent 的新坐标系:训练、延迟、开放部署与真实任务成本

同周的开放权重、闭源 endpoint 与提供商调价把比较重心从单一 benchmark 推向“一次成功任务的端到端成本”。

8/12 的竞争同时发生在训练、开放部署与价格

xAI 称 Grok 4.6 通过更长 supplemental training、重新生成 SFT traces,以及 coding、web、CAD 与 kernel optimization 上的 agentic RL 获得提升;Artificial Analysis 报告 Intelligence Index 61、Terminal-Bench 2.1 88.4%、GDPval-AA v2 Elo 1753。Qwen3.8-Max 则开放 2.4T 总参数、95B 激活、92 层和 512 experts 的权重,原生上下文 262K、可扩展到约 1M,但 BF16 约 5TB,397GB 的动态 1-bit 版本也不是消费级本地模型。

DeepSeek 把 reasoning effort 与峰谷价做成调度变量

DeepSeek V4 Pro GA 强调 Agent upgrades、low/high/max reasoning effort、OpenAI Responses API 与 Codex 配置。官方价格页显示 2026-08-16 16:00 UTC 后启用峰谷价:V4 Pro 每百万 token 的 cache hit 为 0.022/0.044 美元、cache miss 为 0.66/1.32 美元、output 为 1.98/3.96 美元(off-peak/peak)。因此发布前的 0.003625 cache-hit、0.435 input-miss 与 0.87 output 不能继续当作稳定价格;长任务尤其受缓存命中与调度时段影响。

更快的模型会把瓶颈推向工具

Google 将 Gemini 3.7 Flash 定位于 coding、web development、knowledge work 与 agentic workflows,发布方给出 DeepSWE 65.3%、FrontierCode 43.6%、AutomationBench 30.4%,年内 introductory price 为每百万输入/输出 token 0.75/3.75 美元。GPT-5.6 Sol Ultrafast 预览最高 750 tok/s、相对 standard mode 最高 14×。当生成延迟下降到这一量级,浏览器、shell、网络、第三方 API 和 verifier 的等待时间会成为端到端任务的主要部分。

真正的比较单位是一次成功任务

每百万 token 价格只覆盖模型账单,不能代表 Agent economics。输入/输出比例、reasoning effort、cache hit、工具延迟、重试次数、pass@N、人工升级与失败后的环境恢复都要计入。Grok、Gemini、Qwen、DeepSeek 与 Ultrafast 的数字来自不同发布方和 endpoint,不能拼成无条件排行榜;它们共同揭示的是新的 price-performance frontier:训练环境、部署方式、吞吐与 harness 已经和模型权重同等重要。

Harness / Orchestration

Evaluation & harness

Harness / Orchestration

一次分数不再够用:能力属于模型–Harness–评测器组合

Ante 公开 Harbor job 在 89 任务×5 次上得到 368/445,即 82.7% Terminal-Bench 2.1,但部分轨迹时长超过任务 3,600 秒规范,使该数字更适合作为 harness 敏感性案例。

公开轨迹把 82.7% 变成可审计问题

Ante 0.preview.71 在 Terminal-Bench 2.1 的 89 个任务上各跑 5 次,经 OpenRouter 调用 DeepSeek V4 Flash 0731,使用最大推理强度且不加载 skills。公开 Harbor job 记录 445 条轨迹,其中 368 条成功,对应 82.7%(作者报告标准误 ±1.79)。这比只发榜单更有价值,因为任务配置、奖励、异常、时长和 token 使用都能被逐条检查。

超时争议说明分数属于执行契约

社区抽查发现 caffe-cifar-10 的成功轨迹出现 2 小时 14 分和 5 小时 54 分的记录,而任务规范的超时为 3,600 秒。Ante 作者认为可能是 Daytona 时间戳问题,并指出轨迹中仍出现 AgentTimeout;争议尚未闭合。这里不能简单判定“复现成功”或“成绩无效”,但可以确定:超时器、执行资源、提供商速度与判分路径都是 benchmark 定义的一部分。

同模型跨 harness 与长文档任务都暴露系统效应

Composio 在 30 个 agentic tasks、四种 harness 上比较 DeepSeek V4 Flash,报告 Pi Agent 同时取得最低成本和最好表现;Hermes 则把浏览器动作收敛为 CLI 级组合工具,改变了模型每一步要规划的粒度。ExtractBench 的 370 份文档、4,869 页和 67 种文档类型又显示,超过 50 页后 precision 可能仍高,但 recall 会跌到 35% 以下,失败常表现为静默漏行。AA-AnalystAgent 用 pass^5 要求同类任务连续五次成功,报告 Opus 5 为 54%、GPT-5.5 为 50%、Fable 5 为 49%、Kimi K3 为 39%。这些数字来自各自发布方,但共同说明单次平均分会隐藏稳定性。

企业 custom eval 把内部 trace 变成正式资产

Artificial Analysis Optima 支持上传内部数据集、导入 Agent traces、跟踪 quality、cost per task 与 time per task,并做 pairwise judging;Vals Smith 则从 GitHub 仓库生成 custom coding benchmark。它们不自动解决 judge 偏差、数据泄漏或长度偏好,却把“自己的任务、自己的工具、自己的失败轨迹”推到评测中心。一次分数不再足够,最终能力应写成 model × harness × environment × evaluator × aggregation 的联合结果。

Trace privacy & provenance

Harness / Orchestration

Reasoning Trace 泄漏、CoT 隐私与 Watermarking 的三重冲突

披露团队展示了跨模型重放 encrypted reasoning blocks 的风险;同时,提供商和 EU Article 50 正在推动可识别 AI 输出的来源机制。两者对“隐藏过程”与“可追溯结果”的要求并不相同。

首先是公开轨迹中的真实泄漏事件

披露团队称可跨模型重放 encrypted reasoning blocks,并在多数测试查询中观察到恢复 token 与计费 thinking tokens 接近 1:1。对约 7,000 条公开 Agent 轨迹的扫描又报告 62 个唯一 API keys、33 个邮箱和 33 个密码。完整攻击矩阵与论文数字放在 Papers 深读;News 需要保留的现实结论是:rollout、调试日志和公开 trace 仓库会把原本短暂的隐藏状态保存成可批量处理的工件。

这不是“底层加密被破解”

Matthew Green 的早期实验和后续论文都把问题指向协议绑定,而不是 AES、GCM 或签名原语失效:客户端可以复制 opaque block,服务端也可能合法解封它,但 block 未必绑定 user、session、model 与前序状态。即使某个 block 被接受,也不等于每次都能稳定转录高质量 CoT;公开数字更不能直接外推为可规模化蒸馏。

内部 trace 保密与外部 provenance 是两条不同工程线

Anthropic 的支持材料能确认部分文件与工作流使用 metadata/provenance 标记,OpenAI 也公开推进内容来源技术;这不等于任意复制、转述的纯文本都带不可移除水印。短文本熵不足、重写、转码、误报和漏报仍会影响统计标记。保护内部 reasoning 的目标是防止秘密外泄,标记公开输出的目标是建立来源,两者不能用同一种“watermark”概念混写。

EU Article 50 把来源标记推进为合规工程

欧盟透明度 Code 获得约 190 个组织签署,Section 1 有 82 个签署方,包含 Anthropic、Google、Meta、Microsoft、Mistral 与 OpenAI。Article 50 的透明度义务自 2026-08-02 起适用,要求 provider 在 technically feasible 的范围内让音频、图像、视频和文本输出具备 machine-readable marking 并可检测。签署不等于实现完成,也没有规定统一的 token-level watermark;真正的工程问题是把 trace confidentiality、output provenance 和法律可验证性分别做对。

Permission boundary

Harness / Orchestration

Claude Code Auto Mode:把授权变成可恢复的分类与拒绝流程

Auto Mode 在输入侧扫描 prompt injection,在输出侧用两阶段 transcript classifier 检查高风险工具调用;分类器只看用户消息和工具调用,不读 Agent 自身辩解。

Auto Mode 针对的不是恶意推理,而是过度主动

Anthropic 称 Claude Code 用户会批准 93% 的权限提示,持续点击会造成 approval fatigue;与此同时,内部 incident log 记录过误删远程分支、把 GitHub token 上传到内部计算集群、尝试对生产数据库做 migration 等 overeager actions。Auto Mode 因此定位在手工审批与 --dangerously-skip-permissions 之间:让大多数动作继续执行,把真实下行风险交给分类器。

输入与输出各有一层防线

输入侧 prompt-injection probe 在文件读取、网页抓取、shell 输出和外部工具结果进入 Agent 上下文前扫描可疑指令,并向主 Agent 注入警告。输出侧由 Sonnet 4.6 transcript classifier 检查工具调用:第一阶段只输出单 token yes/no,倾向阻断;只有被标记的轨迹才进入第二阶段推理以减少误报。分类器只看用户消息和可执行工具调用,剥离 Agent 自己的解释与工具结果,避免被辩解或注入内容影响。

三级权限把低风险路径从分类器前移

Tier 1 是只读工具与用户明确 allow 的窄规则;进入 Auto Mode 时,能够任意执行代码的 blanket shell/interpreter 规则会被尽量移除。Tier 2 允许项目目录内可由版本控制审查的写入。Shell、web fetch、外部集成、子 Agent、项目外文件操作等真实下行风险才进入 Tier 3 transcript classifier。分类器评估动作的现实效果,而非表面命令文本,并把用户未明确授权的 Agent 自行选择视为未授权。

0.4% 误报换来的仍不是人工审查等价物

在 10,000 条真实内部正常流量上,完整管线 FPR 从第一阶段的 8.5% 降到 0.4%;在 52 条真实 overeager actions 上,FNR 从第一阶段的 6.6% 上升到完整管线的 17%;1,000 条合成外泄任务的完整管线 FNR 为 5.7%。拒绝会回到 Agent,要求其寻找更安全路径;连续 3 次或累计 20 次拒绝才升级给人,headless 模式则终止。该机制让误报可恢复,却不适合替代高风险基础设施上的谨慎人工审批。

Claude Code Auto Mode 评测结果

原图暂不可用,请查看直接来源。

Anthropic 公布的真实流量、真实 overeager actions 与合成外泄任务结果;17% 真实危险动作漏报不能省略。
Claude Code Auto Mode 系统架构

原图暂不可用,请查看直接来源。

输入侧 probe、输出侧两阶段 classifier 与 sub-agent handoff 的发布方架构图。

Memory / Continual Learning

Activity-stream memory

Memory / Continual Learning

OpenAI Computer History:个人活动流成为新的 Agent 记忆单位

OpenAI 介绍 Computer History 为跨应用和网站的计算机活动记录,使 Agent 可在后续任务中搜索过往工作并做个性化处理。

记忆单位从对话扩展到跨应用活动流

OpenAI 在 8/13 宣布 Computer History,让 ChatGPT 记住用户在电脑应用与网站中的活动,以便后续交互更个性化并减少重复解释。与从聊天中抽取偏好不同,活动流可能包含工作路径、浏览顺序、应用切换和时间关系;它因此更接近可检索的外部情景记忆,而不是模型权重的 continual learning。

对 Agent 有价值的是选择、压缩与回溯

长程桌面任务经常跨越多个应用和会话。若活动事件带有来源与时间索引,Agent 可以在后续工作中检索“之前在哪个应用处理过什么”、恢复未完成步骤,并减少用户手工重述。研究问题也随之改变:系统需要决定哪些事件值得保存、如何压缩重复活动、如何纠错和遗忘,以及检索结果怎样保留 provenance,避免旧状态在新任务中被当作当前事实。

产品公告没有回答关键控制问题

当前可访问的一手发布没有说明截图或文本粒度、覆盖哪些应用、本地或云端存储、保留期限、按应用排除、删除传播、跨设备同步、模型训练用途与企业权限继承。官方宣布能够记忆活动,只能证明产品方向和预期价值,不能外推为这些机制均已解决。

长期历史也会保存攻击输入

恶意网页、聊天内容或应用通知一旦进入活动历史,可能在远离原始来源的后续任务中再次影响 Agent;敏感工作流也会在跨应用聚合后产生新的推断风险。Computer History 与本期 runtime 主线应分工阅读:前者讨论个人活动数据怎样进入上下文,后者讨论 runtime 如何保存 workspace、计划、权限和轨迹。可信的活动记忆需要来源标记、每应用控制、可见删除与注入污染防护,而不只是更大的历史窗口。

News 附录

以下均为已确认但信号弱于七条主线的 News。8/14 未发现 smol.ai issue,本期保留该输入缺口,不用其他日期内容补造。

  1. 强模型监督开放模型子 Agent

    社区实践让强模型委派低成本或本地模型执行批量任务,再抽查或只升级失败项;同一批反馈也指出,过度复查可能抵消成本收益。目前没有受控的质量、成本与错误传播实验。

    社区委派案例
  2. Attestable 探索零知识可验证推理

    项目试图证明正确模型、输入和工具确实被执行;Vitalik 估计部分场景可能低于 10× 开销。当前主要仍是项目方性能主张,尚缺公开统一复验。

    Attestable 发布Vitalik 评论
  3. SL2T 把手语身体姿态跟踪放到设备端

    Google DeepMind 的系统在设备端运行 ASL body-pose tracking、服务端完成翻译,并针对单手手语等约束优化;它是移动无障碍界面的有效进展,但未形成通用 Agent 能力证据。

    Google DeepMind 发布系统细节
  4. 小 VLM 与远端规划模型开始分工

    North Micro Vision、LFM2.5-VL-3B 与 Hermes 混合 Agent 把本地视觉模块用于高频感知,把远端强模型用于规划;现有比较主要是厂商演示,先作为模型分工线索。

    North Micro VisionHermes 混合 Agent
  5. 24 小时 GTA-like demo 提供长时自治个案

    Opus 5 社区演示公开了 aaabench harness,但视频、素材来源、人工介入以及成功/失败轨迹不完整,因此只能证明有人进行过长时构建尝试,不能作为通用能力结论。

    社区演示aaabench harness
  6. 高 benchmark 分不等于良好开发体验

    Opus 5 用户报告过度拆解、遗漏关联编辑与输出冗长;words-per-answer 图来源不清。它适合作为本期 benchmark 主线的反例提醒,不能从个案推出模型总体质量。

    使用反馈冗长度讨论
  7. Sakana Chat 提供免登录 code-execution UX

    免费、免登录的日语代码执行体验降低了试用门槛,但目前缺少独特 Agent 机制、权限模型和系统评测,因此保留为产品略读。

    Sakana 发布
  8. DSpark 与 Prime Flash MoE 继续压缩推理延迟

    4× speculative decoding 和专用 MoE kernels 可能降低成本,但当模型生成变快后,工具等待与验证耗时更值得单独计量;本期不把纯推理优化提升为重点 News。

    DSparkPrime Flash MoE

Blogs

3 篇原文重构

← 返回总览

要点速览

01 · Research workflow

Learning more about Claude's mathematical capabilities

核心 takeaway:这不是“模型解出黎曼猜想”,而是一个高预算研究系统在失败搜索中意外找到相邻结果:把既有数学工作组合成新的二次型论证,将满足黎曼猜想的零点比例下界从 41.6% 提高到 67.2%。真正可迁移的贡献是分支探索、失败筛选、独立复证、文献查重、人类专家审阅与 Lean 形式化组成的证据升级链。

“take a real stab”
— 原文关键表述

1. 任务失败,却在相邻问题上产生了可核查结果

Anthropic 员工最初让未发布的研究版 Claude 对黎曼猜想“take a real stab”。模型没有证明这一 1859 年提出的猜想,却在相关问题上找到了新下界:已知位于临界线上的零点比例从 41.6% 提高到 67.2%。文章一开始就限定了结论:Anthropic 不认为这些技术会直接通向黎曼猜想证明;这是一项相邻结果,而不是对原问题的解决。

2. 数学新意来自重新组合既有研究线索

原文将方法放在 Montgomery 1973 年的技术、Aryan 以及 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 的后续工作和 Bombieri 2000 年论文之间。Claude 把 Weil 诱导的二次型放到合适函数空间中,同时处理线上零点形成的正定子空间与线外零点形成的负定子空间,再用一阶、二阶矩信息约束二次型的秩。Anthropic 的解释强调,关键不是发明一个完全脱离文献的新对象,而是敢于把整个空间、正负定性与非对角二次型一起处理。

3. 第一轮 650 个思路全部失败,第二轮才改成多代理深挖

研究版 Claude 在两个 Claude Code session 中共输出约 31M tokens。第一轮生成并尝试 650 个想法,全部失败;第二轮运行一天半,协调约 60 个子 Agent,执行 2,400 条 shell 命令并写了数百个 Python 脚本。精确分工也很重要:2 个 Agent 发展关键数学想法,13 个提供支持思路,30 个尝试新方向但未成功,13 个负责验证,最后 2 个帮助写初稿。大量失败不是被隐藏的噪声,而是搜索空间的主体。

Anthropic 原文披露的研究规模与结果。数字描述单一成功案例,不构成一般科研成功率。核对原文

4. 人类输入很少,但资源分配与停止条件仍由人触发

操作者 Jarred Sumner 不是数学家,原文称其输入主要是“keep going”或“believe in yourself”一类鼓励。这个细节容易被浪漫化:它能说明模型在得到继续探索的许可后改变了资源使用,却不能说明人类监督无关。第一次 650 个思路失败后,是人类要求再次尝试;发现候选结果后,也是系统建议寻找人类数论专家验证。模型负责大部分局部搜索,是否继续投入与何时升级证据仍是运行时决策。

5. 候选证明经历了数值、文献、独立重证与形式化四层检查

子 Agent 对已知 zeta zeros 做了数千次数值检查,互相 referee 论证,搜索反例;系统下载 54 篇 arXiv 论文确认结果是否已被发现,并让另一批 Agent 从头独立重证。Anthropic 的 Levent Alpöge 与 Ralph Furman 研究结果和既有工作之间的关系,Brian Conrey 与 Dan Goldston 在短时间内检查论文;Claude 又与 Eric Easley 产出通过标准验证工具的 Lean formalization。每一层回答的问题不同:数值检查找明显反例,文献检索检查新颖性,专家判断检查数学语义,Lean 只验证已经编码的命题与证明步骤。

6. 这个案例更像科研 harness 的压力测试

从 Agent 研究视角看,重要机制不是上下文无限增长,而是把探索、验证、写作和形式化分配给不同角色,并把可执行计算留给 shell 与 Python。31M 输出 token、数千次数值检查和 54 篇论文复核说明,该结果依赖高预算、工具可用性和多层审查。若失败方向、反例与已检查文献不能被共享,60 个 Agent 很容易重复走回同一死路;因此共享研究状态与独立验证者比“再开一个子 Agent”更关键。

7. 单一成功案例不能给出一般科研成功率

原文来自 Anthropic,模型尚未发布,也没有同预算的单 Agent、无工具或无形式化对照。文章公开了过程数字和详细 transcripts,却没有给出所有开放问题上的命中率、总推理成本或失败项目分布。它能支持的结论是:在极低命中率的数学搜索中,多分支探索与证据升级可能产生有价值的相邻发现;它不能支持“60 个 Agent 可稳定完成原创数学”或“鼓励语句本身造成突破”。

02 · Strategy & governance

The Future is for Everyone

核心 takeaway:这是一篇把产品路线、政治哲学与安全观绑在一起的宣言。Meta 的核心论证是:superintelligence 应优先用于 invention,由个人而非少数机构决定目标,并通过广泛分发形成 balance of power;24/7 personal agent、fully private mode、开放模型和独立董事会是这套主张的产品与治理落点,但多数仍是承诺而非已交付功能。

“individual empowerment … invention … balance of power”
— 原文关键表述

1. 文章先把问题定义为“谁能使用、由谁决定目标”

开篇提出个人赋权、发明和权力平衡三条原则:individual empowerment 是繁荣来源,invention 是 superintelligence 的主要目的,balance of power 是安全基础。Meta 反对把极端集中权力当作唯一安全路径,借历史技术扩散说明,个人获得更强工具可能扩大而非削弱社会创造力。这个起点决定全文不是模型发布说明,而是一套规范性立场。

2. Invention 被放在 automation 之前

文章区分了早期 AI 的问答与例行工作自动化,以及未来系统发现新药、改进企业和推进科学的能力。Meta 认为人的每日提问有限,但围绕个人目标可发明的有价值事物近乎无限;科学 Agent 还会跨周或跨月测试与修订假设。这与本期 Anthropic 数学案例形成呼应,但仍然是对未来用途的判断,并没有给出个人 Agent 跨月运行的成功率。

3. Personal agent 被设想为跨生活域、跨设备、24/7 的委托人

最具体的产品描述是每个人拥有理解其目标和关切的高能力 Agent,持续处理关系、健康、职业、财务、家庭管理与兴趣,并可通过眼镜等设备交互。文章同时承诺强隐私和安全选项,类比 WhatsApp 加密;后文进一步提出 fully private mode,即 Meta 或其他服务商也不能查看或授权访问个人信息。要让这类产品成立,跨应用身份、权限、活动记忆、目标冲突和本地/云端执行边界都必须变成可见机制。

编辑部按原文顺序重绘:技术分发被用来支撑一套安全与治理哲学;每个箭头都仍需要产品机制和制度记录验证。核对原文

4. 广泛分发同时包含免费层、算力拍卖与开放模型

Meta 承诺向数十亿人提供免费或可负担版本,对需要更多 compute 的用户使用 dynamic auction,以最低可用价格分配稀缺算力。文章还把 open source 视为防止集中和提升安全的力量,并宣布恢复发布部分开放模型。Muse Glimmer 的 Apache 2.0 权重与消费级部署是本周能看到的工程侧证,但 30B 本地模型并不等于文章所称的 superintelligence,也没有实现整套私密 Agent。

5. Balance of power 被用来回答 cyber、bio 与政府权力风险

文章认为开放系统可被更多人发现和修复漏洞,并建议前沿实验室向政府提供中间训练 checkpoint 与工程人员,用于提前加固关键基础设施;生物与化学风险则优先控制有害材料的物理生产与分发,同时加速治疗与防护研究。这个方案一贯选择“分发能力 + 加固现实系统”,而不是普遍限制知识,但其有效性取决于政府访问、实验室协调和关键基础设施治理是否真正可审计。

6. Alignment 被重新定义为对个人目标忠诚

Meta 批评由公司集中规定价值的 alignment,主张 Agent 应分享个人的目标与价值,同时保留法律和安全边界。问题在于“个人”并不总是单一主体:共享设备、家庭、雇主、平台和第三方权利可能互相冲突。若系统不展示目标来源、冲突优先级、谁授权了哪次动作,以及何时调用云端,“对个人忠诚”仍然只是价值宣言,无法成为可测试的产品属性。

7. RSI 让算力分配本身成为权力平衡问题

文章设想 autonomously self-improving systems 可能通过效率突破获得远超其硬件占比的有效智能,因此多实验室同时达到 RSI、或为公众目标保留显著多数 compute,才可能避免单一系统形成支配力。Meta 提出要在维持竞争力的同时,让显著多数智能继续由人类目标驱动。这一段把 runtime 和经济问题推到安全中心:谁控制持续运行、更新目标与算力预算,比单次模型输出更接近实际权力。

8. 独立董事会是治理承诺,也是未来可核查点

Meta 宣布让独立董事会批准模型发布的安全标准并审查每次发布是否遵循标准,称不希望由创始人或 CEO 独自决定 superintelligence 部署。该安排只有在标准、审查记录、否决权与例外处理可见时才形成真实约束。整篇文章最适合作为“Meta 希望如何分配能力与权力”的一手文本,而不是已交付产品清单;其可验证性将落在默认权限、私密模式、开放发布、算力定价和董事会实际决策上。

03 · Cryptographic threat model

Let's talk about encrypted reasoning

核心 takeaway:文章真正发现的不是“加密算法被破解”,而是 reasoning state 作为客户端代管的 opaque ciphertext 后,会同时出现重放与侧信道两类协议风险:未绑定账户/会话/模型的 block 可能被服务端在错误上下文解封;即使正文不可读,长度、reasoning token 与响应时间也可能泄露 secret-dependent reasoning。作者自己的攻击效果有限,但 8/11 的后续论文把重放发展成了实际轨迹窃取。

“Let’s break that rule.”
— 原文关键表述

1. 一个 API 错误暴露了隐藏状态的存在

Matthew Green 在配置 OpenClaw 连接 Claude 时看到 thinking block 的签名错误,由此追问为什么 API 要把隐藏推理交给客户端。OpenAI Responses 与 Anthropic Messages API 都可能返回 Base64 编码的 opaque reasoning/thinking data;客户端看不到原始 CoT,却需要在后续轮次原样带回。作者用约 20 小时和 5M Codex tokens 探索这一机制,并用一句“Let’s break that rule”把文章从接口说明转入攻击实验。

2. 客户端代管源于无状态、零保留和工具循环

服务端生成响应时可以访问 reasoning state,但 API 对话并不总是持久 session;在 stateless、zero-retention、tool loop 或 client-managed conversation 中,应用需要自己携带 transcript。Authenticated ciphertext 让 provider 把隐藏状态交给客户端保存,客户端不能读或改,却能在下一轮返回给服务端继续推理。这个设计解决状态续接,同时让 blob 变成可复制、归档和跨上下文重放的工件。

3. 完整性保护没有阻止跨会话和跨账户重放

修改任何 bit 会触发 API 拒绝,但原封不动的旧 block 可以在同会话、不同会话,甚至不同账户间被接受;OpenAI 的实验还观察到跨模型重放,Claude 家族对跨模型更挑剔。作者由此推测 provider 可能使用范围很大的共享密钥,而不是每账户频繁轮换的 key。这个推断不能仅凭接受响应证明内部密钥结构,但足以说明 block 没有被强绑定到最小上下文。

Matthew Green 对 OpenAI reasoning block 格式的推测图

原图暂不可用,请通过图源链接查看。

Green 对 OpenAI reasoning block 结构的推测图;作者明确标注它部分基于猜测,不能当作 provider 官方格式。图源与说明
80 次 secret bit 侧信道实验结果

原图暂不可用,请通过图源链接查看。

原文的 80 次实验:字节 0xA3 的 8 个 bit 各测试 10 次,以隐藏推理长度区分 0/1;它证明设置内存在侧信道,不等于可稳定恢复任意秘密。图源与上下文

4. Block 能够语义生效,但作者没有稳定抽出高价值秘密

某些重放只被模型静默吸收,少数实验中目标 session 会输出源 session 思考过的社会安全号码,说明解封后的内容至少有时对模型语义可见。然而,当源模型被明确要求不要输出秘密时,重放后的模型多数仍遵守限制。Green 反复强调这是令人失望的 hobby project:他能证明明文内容也可能进入密文状态,却没有证明存在可靠的通用“解密咒语”。这一步限制了文章可以外推的攻击强度。

5. 第二条风险来自长度、token 与时间侧信道

客户端能观察 blob 大小、reasoning_tokens 和 wall-clock latency。作者让模型根据一个秘密 bit 选择简单计算 A 或复杂计算 B,同时保持可见答案相同;复杂度差异会反映到隐藏推理长度和响应时间。实验对字节 0xA3 的 8 个 bit 各运行 10 次,共 80 次,并展示 0/1 类在长度与时间上的可分信号。这里泄漏的不是 ciphertext 内容本身,而是 secret-dependent computation 的资源形状。

6. 想提取不存在的 system prompt,反而暴露实验幻觉

作者随后尝试逐 bit 恢复所谓模型 system prompt,却发现 API 模式下的 GPT 与 Claude 并不存在他假设的那类 prompt;模型仍会声称存在并编造看似合理的文本。使用 coding Agent 自动化实验还放大了这种误导。最终他只能确认 application-specific secrets 在某些设置下可被侧信道区分,无法确认从公开 API 提取模型级秘密。这段失败记录很重要:安全研究 Agent 需要独立 ground truth,否则会把模型自述当作攻击成功。

7. 协议修补与侧信道修补是两套问题

重放问题可以从 key management 与上下文绑定入手:至少把 block 绑定账户、会话、模型、版本和前序状态,并对聊天接口的 JSON 注入做净化。侧信道却不会因更换加密协议消失;只要模型根据秘密选择不同计算路径,长度、token 和时间仍可能泄漏。作者提出在模型开始 secret-dependent reasoning 之前做 policy gate,但也指出 gate 本身往往需要推理,因此这里没有简单的一层式修补。

8. 8/11 更新把 hobby project 与本周论文连接起来

Green 在文章顶部更新称,欧洲研究者受本文启发,已经把思路发展为真正可工作的攻击。Blog 的价值是展示问题如何从签名错误、重放和侧信道逐步被提出,并诚实记录失败;本期 Stealing Reasoning Traces 论文深读则负责提供跨 provider 矩阵、公开轨迹扫描规模和披露时间线。两者合读时不能把早期 80 次侧信道实验与后续 315,320 个 reasoning blocks 当作同一组证据。

Papers

12 篇深读 · 22 篇结构化略读

← 返回总览

要点速览

五个方向均按研究问题组织;深读链接打开独立学术解读,略读保留贡献、证据与不展开理由。

Long-horizon Agents

这一方向把长程能力拆成持续环境、发现、科研工作流与大规模重构,重点观察任务在时间推进和状态变化后是否仍能恢复目标。

Agentic RL / Training Infrastructure

这一方向追问训练环境不是越多越好,而要同时设计能力覆盖、难度分层、on-policy 信号和视觉证据奖励。

GUI / Computer / Mobile / Browser Use

这一方向将长视频与 GUI 环境视为持续流,比较实时反应、异步记忆、交互成本和最终任务保真度。

Harness / Orchestration

这一方向直接测量 scaffold、工具接口、skills、eval 与执行策略如何改变同一模型的能力、成本和安全。

Memory / Continual Learning

这一方向区分模型参数更新、分层外部记忆、recurrent state 与显式世界状态,关注经验能否迁移而不放大陈旧信息。

深读

Long-horizon Agents · 深读

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

核心亮点:VibeLifeBench 的主要贡献不是再增加一批静态工具题,而是把生活环境写成会继续演化的事件系统,让评测能观察主动性、持久性和静默失败。

  • 研究问题:当生活服务、日历、通知和共享状态在长时间轴上自主变化时,Agent 能否主动发现新事件、维持承诺并完成跨服务任务。
  • 核心方法:200 个任务覆盖 10 个生活领域;22 个服务暴露 288 个工具;7,453 个时间轴事件驱动环境;12,261 个加权检查项评分最终状态
  • 关键证据:69.9% 的任务受环境事件驱动;1,483 次静默状态变更;Claude Opus 5 avg@3 32.5,max 41.2;DeepSeek V4 Pro avg@3 21.1
  • 边界与影响:强模型的绝对得分仍低,这同时可能反映环境难度、工具语义和评分严格度,不能只归因于规划;Terrarium 官方仓库包含生活环境基础设施,审计的提交中未找到论文所述 200 题完整套件,因而不能宣称全量复现

来源:HF · arXiv

展开深度解读
vibelife-2608.10875-解读.html新窗口打开

Long-horizon Agents · 深读

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

核心亮点:OpenART 将红队测试从一次性恶意指令扩展到可合法改变的持久环境:任务与安全合约保持不变,攻击者只调整环境状态和路径。

  • 研究问题:Agent 安全风险会否随共享环境的累积状态变化而放大,以及运行时身份能否解释模型权重之外的差异。
  • 核心方法:10,000+ 经验证状态场景;50 个领域与 500,000+ tools/MCPs/skills 能力池;任务工具调用中位数 97;EMHA 在马尔可夫超图上做反馈驱动的状态进化
  • 关键证据:15 agents × 5 foundation models = 75 个组合;pooled strict ASR 85.0%;复杂环境上比 instruction-only 高 17.2–17.6 个点;target-agent identity 额外解释 7.6% ASR 变异
  • 边界与影响:85.0% 是论文实验设置下的严格攻击成功率,不能直接作为现实部署的漏洞概率;500K 描述能力池规模,可执行性、许可证和环境真实性需分别审计

来源:HF · arXiv

展开深度解读
openart-2608.00677-解读.html新窗口打开

Long-horizon Agents · 深读

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

核心亮点:Spark-to-Paper 将 13 个 composable skills 嵌入现有 coding assistant,把需要模型判断的环节与可确定执行的 gate 分离,并要求在看到结果之前先写明证据需求。

  • 研究问题:科研 Agent 如何在长轨迹中把检索、实验、主张修订、引用与可编辑图表组成一条可审计流水线。
  • 核心方法:13 个 skill 组成 plan–cite–write–refine–data 流程;实验规划先于结果,降低结果后假设;deterministic lint/gate 与模型 self-critique 并用;Self-Refutation Loop 为可检测失败模式
  • 关键证据:8 个受控研究主题;citation validity 99.5%;figure editability 96.4%;fabrication detection 14% → 92%
  • 边界与影响:只有 8 个受控主题,无法覆盖需要大规模 GPU、湿实验或专家数据的研究;citation validity 与 figure editability 是工程完整性,不是新颖性、因果性或科学正确性的代理

来源:HF · arXiv

展开深度解读
spark-to-paper-2608.11924-解读.html新窗口打开

Long-horizon Agents · 深读

DiG-bench: Discovery in Games

核心亮点:DiG-bench 用 70 个短字符串游戏把 discovery 变成可控实验:玩家必须自己决定探索动作,提出机制假设,再把假设迁移到后续关卡。

来自 News 线索:本周 News 同时提及,方法和数字仅在 Papers 展开。

  • 研究问题:当规则、目标与胜利条件全部隐藏时,Agent 能否通过主动实验形成可泛化规律,而非只执行已知指令。
  • 核心方法:70 个独立游戏,7 个难度层;21 个公开题、49 个私有题;creative mode 允许受控 sandbox 实验;basic harness 覆盖七层,agentic harness 聚焦最难两层
  • 关键证据:基础 harness 所有模型合计解出 57/70;Claude Opus 5 解出 50/70,Qwen3.6-27B 为 1/70;最高两层最佳模型并集仅 9/20;Gemini 获得规则时 69/70,不获得规则时 18/70
  • 边界与影响:多数模型—游戏组合只运行单种子,难以估计随机性和策略方差;闭源模型往往使用 100–200 美元上限或 12 小时上限,不同资源限额让绝对排名难以视作纯模型比较

来源:HF · arXiv

展开深度解读
dig-bench-2608.12593-解读.html新窗口打开

Agentic RL / Training Infrastructure · 深读

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

核心亮点:论文的核心否定是“环境越多越好”。AES 先按能力空间选择互补环境,HDC 再用 harness weakening 与 state-scale progression 构造层级课程。

  • 研究问题:多模态 Agent 训练的环境池扩张之后,决定收益的是数量,还是能力多样性与难度结构。
  • 核心方法:AES 使用能力信号最大化环境集多样性;HDC 在 harness 弱化和状态规模两条轴上分级;环境集同时覆盖文本与多模态任务;官方仓库开放选择、采样和评估配置
  • 关键证据:盲目混合环境后文本能力下降 1.3%;多模态能力下降 10.7%;AES 与 HDC 的完整组合优于单纯规模扩张;主论文包含能力选择与课程分解实验
  • 边界与影响:环境 diversity 的度量依赖表征和能力标签,标签错误可能变成选择偏差;HDC 需要额外的难度探测和配置工作,因而样本效率收益应与前处理成本同时报告

来源:HF · arXiv

展开深度解读
environment-distributions-2608.03571-解读.html新窗口打开

GUI / Computer / Mobile / Browser Use · 深读

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

核心亮点:StreamArena 指出短片段和选择题会让“只看最后四帧”的基线伪装成长视频理解。StreamMind 于是将实时前端 worker 与异步记忆/检索后端分层。

  • 研究问题:连续视频流中的 Agent 如何同时保持低延迟前端反应和小时级、可回溯的多模态记忆。
  • 核心方法:243 个完整视频,平均 88.8 分钟;3,646 个 open-ended QA;四类能力:实时感知、历史回溯、主动交互、外部工具;前端 worker 独立调度,后端 worker 异步构建 persistent memory
  • 关键证据:池化延迟 81.4s 降至 27.5s,降幅 66.2%;real-time perception 延迟降低 84.6%;historical retrospection 降低 73.9%;tool use 降低 55.3%
  • 边界与影响:QA 评分虽然去除了选项提示,仍不等于在现实 GUI 中安全执行动作;准确率保留 89.7% 意味着延迟收益伴随质量损失,不应只报“快 66.2%”

来源:HF · arXiv

展开深度解读
streamarena-2608.05703-解读.html新窗口打开

Harness / Orchestration · 深读

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

核心亮点:AI4AI 把 harness 设计本身变成一个强模型可优化的对象:builder 只看每个 Theory-of-Mind benchmark 的 5% validation,反复修改脚手架,最后才在完整 test set 上冻结评估。

  • 研究问题:强模型能否在不改变弱模型参数的前提下,仅通过 test-time harness 把不稳定推理改写为确定性程序与路由。
  • 核心方法:builder model 迭代生成/修订 scaffold;target model 参数与解码设置冻结;每项任务 5% validation 用于构建;有效 harness 多用确定性计算、路由和格式约束
  • 关键证据:GPT-5.4-mini vanilla baseline 0.488;57 个 scaffolded runs 平均 0.763,+0.275;100% runs 高于 vanilla baseline;最佳运行 0.912,+0.423,相对提升 86.7%
  • 边界与影响:5% validation 虽与 test 分离,但 builder 仍能为单一 benchmark 进行结构性调参,因而“能力迁移”应限定为评测族内;四个 Theory-of-Mind benchmark 共享较强结构和可程序化步骤,不代表开放式工具任务

来源:HF · arXiv

展开深度解读
ai4ai-2608.12307-解读.html新窗口打开

Harness / Orchestration · 深读

Stealing Reasoning Traces from Proprietary LLM APIs

核心亮点:论文展示的不是破解密码学,而是 API 协议缺少身份、会话、模型与链式状态绑定:服务端自己解封 block 后,目标模型可被诱导转录其中内容。

来自 News 线索:本周 News 同时提及,方法和数字仅在 Papers 展开。

  • 研究问题:提供商返回的 encrypted reasoning block 如果可以跨模型、会话或用户重放,较弱模型是否会成为隐藏轨迹的解码 oracle。
  • 核心方法:收集公开 Agent 轨迹中的签名/加密 block;将强模型 block 注入同提供商的另一模型;通过 current-turn、past-turn 或 visible-prefix 引导输出;建议用 user/session/model 与前一 token hash 链式绑定
  • 关键证据:6,708 条公开 trajectories;315,320 个重建/扫描 reasoning blocks;编辑档案记录 367 个 PII artifacts 与 182 个 credentials,需按论文筛选口径读取;跨模型兼容覆盖当时测试的 Anthropic、OpenAI、Google 家族
  • 边界与影响:结论是特定 API 版本和协议的系统性缺陷,不是底层加密算法被破解;论文报告了 2026 年 7 月的兼容性矩阵,提供商修补会改变当前风险,不能把历史结果写成永久现状

来源:HF · arXiv

展开深度解读
reasoning-traces-2608.09867-解读.html新窗口打开

Harness / Orchestration · 深读

DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds

核心亮点:DCAS 是 backend-substitution interception layer:不修改 Claude Code、OpenCode、OpenHands 或 mini-swe-agent 本身,便可替换后端模型、统一采集轨迹,并分离显式 plan artifact 与隐式执行结构。

  • 研究问题:主要用 OpenHands trajectories 微调的开放 coding model,是否学到了 scaffold 特定的规划惯例,因而在更换 CLI scaffold 时性能崩塌。
  • 核心方法:DCAS 在 scaffold API 与 backend model 之间代理路由;RQ1 固定 executor,只替换 plan source;RQ2 比较 PlanOnly 与 Plan+Exec 微调;RQ3 在未见 scaffold 和新版本上评估迁移
  • 关键证据:SWE-Lego-Qwen3-32B:OpenHands 52.6%,OpenCode 8.4%;Nebius-SWE-Rebench-30B:OpenHands 49.7%,mini-swe-agent 20.4%;576 条保留 planning trajectories 生成 36,259 个 per-turn Plan+Exec 样本;Plan+Exec 在 CC 2.0.76:42.8→52.8,self-plan 到 55.8
  • 边界与影响:各 scaffold 的工具 schema、上下文管理和终止规则不同,backend 替换不能保证语义完全等价;论文聚焦 SWE-bench Verified 和 30B–32B 模型,是否迁移到数据分析、GUI 或非代码 Agent 尚不明确

来源:HF · arXiv

展开深度解读
dcas-2608.06113-解读.html新窗口打开

Harness / Orchestration · 深读

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

核心亮点:这项工作的价值是差分归因:目标 skill run 必须与能成功解决同一任务,或以更低成本解决任务的 no-skill/语义匹配 skill run 对照,然后再做人工 taxonomy 审核。

来自 News 线索:本周 News 同时提及,方法和数字仅在 Papers 展开。

  • 研究问题:当 skill 看似与任务相关却降低成功率或推高成本时,如何用配对运行把 skill-induced failure 从任务难度和模型方差中分离。
  • 核心方法:SkillsBench 与 SWE-Skills-Bench 合并;with/no-skill 与 cross-skill 两种配对;20,664 个扩展候选对;SkillTriage 规范化轨迹并产生差分证据报告
  • 关键证据:665 个 labeled candidates 审计为 307 个分析案例;125 个功能失败,182 个效率回退;Task-Implementation Fault 86/125,68.8%;Excessive Procedure 114/182,62.6%
  • 边界与影响:只有一个 skill run 失败且对照成功时才能进入归因集,这会选中更容易寻找差分证据的案例;差分运行不是随机对照试验;模型采样方差、运行时状态与对照匹配仍可能影响归因

来源:HF · arXiv

展开深度解读
harmful-skills-2608.11888-解读.html新窗口打开

Memory / Continual Learning · 深读

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

核心亮点:Macaron-V1 是一个架构与基础设施合并的系统报告:冻结 base,每轮选择 chat、agent、coding 或 GenUI LoRA,同时用 HCP contract 记录 harness 版本与外部评估。

  • 研究问题:Agent 能否把真实环境经验转化为可版本化的 model–harness successor,并通过 Mixture-of-LoRA 在单轮中路由专家能力。
  • 核心方法:Venti 使用 744B GLM-5.2 base 与四个 LoRA;Tall 使用 Qwen3.6 50B 级 base 做本地部署;Proxy 执行 route–answer–summary 三段循环;HCP 把 model–harness 对与评估合约版本化
  • 关键证据:6,448 样本路由准确率:Venti 99.12%,Tall 99.04%;三段循环总延迟:Venti 4.68s,Tall 1.76s;Venti answer hop 3.17s,占 68%;路由/KV 奖励实验每臂仅 n=5,无稳定改善
  • 边界与影响:路由准确率高只证明四类标签选择稳定,不等于任务成功率提升;奖励实验每臂只有 5 次,不足以支持“路由或 KV reuse 改善 Agent 表现”的强结论

来源:HF · arXiv

展开深度解读
macaron-v1-2608.09819-解读.html新窗口打开

Memory / Continual Learning · 深读

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

核心亮点:AMD 将 teacher 成功轨迹分解为 Workflow、Subtask 和 Function 三层:前两者在任务开始时主动注入,Function memory 只在 tool-call error 后反应式检索。

  • 研究问题:小模型无法自主产生足够成功轨迹时,能否不训练参数,而用分层外部记忆吸收强 teacher 经验。
  • 核心方法:teacher 只从成功 trajectories 提取记忆;Workflow 表示任务级策略;Subtask 保存中粒度行为例子;Function 记录调用约定与常见错误
  • 关键证据:平均绝对提升:AppWorld +27.2pp、BFCL V3 +11.2pp、ToolSandbox +3.4pp;Qwen3-4B:AppWorld +34.52pp,BFCL +23.00pp,ToolSandbox +3.88pp;Subtask memory 贡献最大;teacher 更强不保证 student 更好,兼容性与能力同样重要
  • 边界与影响:记忆只来自 teacher 成功轨迹,失败边界、不应采用的策略和反例可能被系统性忽略;teacher 准确率与 student 收益不单调,说明表述风格、工具惯例和能力差距会影响迁移

来源:HF · arXiv

展开深度解读
agent-memory-distillation-2608.07169-解读.html新窗口打开

略读

Long-horizon Agents

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

  • 贡献:170 个专家整理的多语言大规模重构任务,平均修改 11.4 files/261.6 LOC,最佳 resolve rate 仅 41.2%。
  • 证据:170 个专家整理的多语言大规模重构任务;平均修改 11.4 files/261.6 LOC。
  • 略读原因:数据构造严谨,但仍是代码单域,用于校准长程难度即可。

来源:HF · arXiv

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

  • 贡献:跨境商店模拟器同时引入延迟收益、监管约束和 action-level attribution,15 模型最终净资产相差 9×。
  • 证据:15 模型最终净资产相差 9×。
  • 略读原因:长期决策很有价值,但业务 vertical 和经济假设限制外推。

来源:HF · arXiv

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

  • 贡献:100 个交互叙事环境测量长期 commitment,最佳 GPT-5.2 在 20 turns 后 survival 仅 42%。
  • 证据:100 个交互叙事环境测量长期 commitment;最佳 GPT-5.2 在 20 turns 后 survival 仅 42%。
  • 略读原因:长期一致性信号清晰,但叙事承诺与真实工具任务仍有距离。

来源:HF · arXiv

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

  • 贡献:Agent 通过 reviewed commits 修改工具、prompts 与 core,报告 161 天持续运行及 TB2.1 86.74%/OSWorld-V 90.69%。
  • 证据:报告 161 天持续运行及 TB2.1 86.74%/OSWorld-V 90.69%。
  • 略读原因:长期部署罕见,但模型、运行时与人工评审同时变化,难以归因。

来源:HF · arXiv

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

  • 贡献:SRE-Bench 用 19 个私有程序、262 binaries 和 1,572 deterministic tasks 测逆向工程,最佳完整解决仅 31.5%。
  • 证据:SRE-Bench 用 19 个私有程序、262 binaries 和 1,572 deterministic tasks 测逆向工程;最佳完整解决仅 31.5%。
  • 略读原因:污染控制和确定性评分值得借鉴,但 cyber vertical 不占深读。

来源:HF · arXiv

Agentic RL / Training Infrastructure

On-Policy Self-Distillation without Any Supervision

  • 贡献:无外部监督的 on-policy self-distillation 只蒸馏学生分歧样本,Qwen3 4B/8B 在五数学集提升 8.5%/10.7%。
  • 证据:Qwen3 4B/8B 在五数学集提升 8.5%/10.7%。
  • 略读原因:方法简洁,但实验未进入多步 Agent 环境。

来源:HF · arXiv

Intern-S2-Preview: Scientific Agentic Foundation Model

  • 贡献:科学 Agent 基础模型合并多种 agentic RL、on-policy distillation 和独立 memory decoder,Biology-Instructions 56.92→60.32。
  • 证据:Biology-Instructions 56.92→60.32。
  • 略读原因:训练栈组件太多,摘要无法归因单一机制。

来源:HF · arXiv

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

  • 贡献:SPOT 用 teacher entropy、top-k mass 和 student–teacher mismatch 分配有限 probing budget,再以 verifier outcome 校准目标。
  • 证据:SPOT 用 teacher entropy、top-k mass 和 student–teacher mismatch 分配有限 probing budget。
  • 略读原因:解决局部概率与最终成功不一致,但缺少 Agent 任务绝对数字。

来源:HF · arXiv

Weak-to-Strong Generalization via Direct On-Policy Distillation

  • 贡献:用弱模型 pre/post-RL log-ratio 当作 dense implicit reward,Qwen3-1.7B AIME24 从 48.3% 到 62.4%。
  • 证据:Qwen3-1.7B AIME24 从 48.3% 到 62.4%。
  • 略读原因:训练效率证据强,但仍是数学 reasoning,未解决 Agent 长期 credit assignment。

来源:HF · arXiv

Evidence-RL: Towards Evidence-intensive Visual Reasoning

  • 贡献:Evidence-RL 通过遮挡 object-centric evidence region 估计反事实支持度,与 correctness 共同进入 GRPO。
  • 证据:论文摘要与主结果给出方向性证据,本期未展开完整消融与跨设置复核。
  • 略读原因:视觉 grounding 奖励有启发,但没有 GUI action loop。

来源:HF · arXiv

GUI / Computer / Mobile / Browser Use

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

  • 贡献:100K 真实多轮图像创作对话显示 80.1% 建议依赖图像,百万用户 A/B 中不一致性 3.7%→0.9%,CTR +32.70%。
  • 证据:100K 真实多轮图像创作对话显示 80.1% 建议依赖图像;百万用户 A/B 中不一致性 3.7%→0.9%。
  • 略读原因:线上证据罕见,但 engagement 不是 GUI task correctness。

来源:HF · arXiv

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

  • 贡献:PlayWorld 用 171 scenarios 和目标自适应 Agent Players 评估 world model 的几何、交互与视野外演化。
  • 证据:PlayWorld 用 171 scenarios 和目标自适应 Agent Players 评估 world model 的几何、交互与视野外演化。
  • 略读原因:交互评测设计可迁移,但被评对象是生成式 world model。

来源:HF · arXiv

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

  • 贡献:frozen VLM 从可验证空间环境归纳 procedure memory,用 Transfer Reliability Score 联合语义相似度检索。
  • 证据:论文摘要与主结果给出方向性证据,本期未展开完整消融与跨设置复核。
  • 略读原因:runtime memory 机制有价值,但任务聚焦 spatial/embodied reasoning。

来源:HF · arXiv

Harness / Orchestration

DarwinX: Evolving Agent Harnesses Through Natural Selection

  • 贡献:DarwinX 将 harness 空间表示为可继承的组件并做变异搜索,用评分与成本选择 successor。
  • 证据:论文摘要与主结果给出方向性证据,本期未展开完整消融与跨设置复核。
  • 略读原因:与 AI4AI、Macaron 的自改进议题重叠,保留方法对照即可。

来源:HF · arXiv

The Bitter Lesson of Tool Calling

  • 贡献:分析 tool calling 中通用模型与专用脚手架的取舍,强调工具描述、返回值和运行时约定对结果的作用。
  • 证据:论文摘要与主结果给出方向性证据,本期未展开完整消融与跨设置复核。
  • 略读原因:主题重要但本期已有 AI4AI/DCAS 提供更强的实验对照。

来源:HF · arXiv

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

  • 贡献:SkillZip 把大型 skill library 表示为 section-level execution graph,以可逆 macro 压缩并保持 dependency closure;最高提升 12.2 points、压缩 3.46×、依赖保留率 99.2%。
  • 证据:最高提升 12.2 points、压缩 3.46×、依赖保留率 99.2%。
  • 略读原因:直接回答 skill 预算问题,但本期 harmful-skills 深读更需要版面,故保留可核查数字与机制后略读。

来源:HF · arXiv

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

  • 贡献:从训练 split trajectories 编译自然语言 skill,在四个 Agent benchmarks 恢复 55%–100%+ reasoning gap,输出 token 少 2.7–6×。
  • 证据:在四个 Agent benchmarks 恢复 55%–100%+ reasoning gap;输出 token 少 2.7–6×。
  • 略读原因:结论有吸引力,但模型 family 与领域较少,且需与 SkillZip/harmful-skills 联合阅读。

来源:HF · arXiv

Evo-Bench: Can Language Models Improve Agent Harness?

  • 贡献:Evo-Bench 用 auxiliary-task evolution 与 sensitivity-aware split 隔离 harness-evolving ability;9 个模型最高绝对增益 16.6 points,并观察到 task-domain early saturation。
  • 证据:9 个模型最高绝对增益 16.6 points。
  • 略读原因:评测设计能抑制静态题库记忆,但本期只作为 harness 自进化论文的互补测量,不展开全部模型矩阵。

来源:HF · arXiv

Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations

  • 贡献:用概化理论分解 Agent、task 与二者交互方差;三个 benchmark 中 agent main effect 低于 3%,agent×task 为 7%–23%。
  • 证据:三个 benchmark 中 agent main effect 低于 3%;agent×task 为 7%–23%。
  • 略读原因:统计结果直接挑战排行榜,但主要属于 evaluation methodology,在本期能力联合系统专题中对照即可。

来源:HF · arXiv

Memory / Continual Learning

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

  • 贡献:150M recurrent latent model 在 inference demonstrations 上更新状态,ARC-AGI-1 public 报告 29.5% pass@2,$0.0007/task。
  • 证据:150M recurrent latent model 在 inference demonstrations 上更新状态;ARC-AGI-1 public 报告 29.5% pass@2。
  • 略读原因:recurrent state 有记忆启发,但是单次推理架构而非跨会话 Agent memory。

来源:HF · arXiv

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

  • 贡献:26 个可比 7B 模型与 170K GPU hours 显示,多种微小架构选择组合可使 long-context downstream 下降最多 47%。
  • 证据:26 个可比 7B 模型与 170K GPU hours 显示;多种微小架构选择组合可使 long-context downstream 下降最多 47%。
  • 略读原因:暴露长上下文底座限制,但不研究 Agent 写入、检索与遗忘。

来源:HF · arXiv

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

  • 贡献:StateFlow 用 persistent structured 3D state 保存 scene elements/cameras,局部演化后再通过 render feedback 修正。
  • 证据:StateFlow 用 persistent structured 3D state 保存 scene elements/cameras。
  • 略读原因:显式可编辑世界状态可迁移,但主要服务于 previsualization。

来源:HF · arXiv