AI NewspaperGUI | Agent | RL 视角

AI NewspaperGUI | Agent | RL 视角Issue 21 · ISO 2026-W34报道周期

DeepSeek 将单图控制在 384 Tokens 内,GUI Agent 开始重算任务成本

本周重要模型与版本发布密集:DeepSeek-V4-Flash-Vision-Exp 主打低成本原生视觉,Gemini 3.7 Flash 把办公任务带上质量—延迟—成本前沿;Qwen3.8-27B 聚焦本地 Agent,GLM-5.3 / Ornith-1.5 则继续推进长时 RL 与自生成 Rollout。 先读 TrueForge 如何把沙箱、审批和会话恢复交给开放运行时,再对照 DeepSeek Harness 的全插件内核与 Shopify Gisting 如何直接削减长提示的上下文税。 StateM 追问显式状态如何扩展长任务,Agent Lightning v1.0 处理 Harness 接管后的 RL 样本归因,MemTrapBench 则解释真实且相关的记忆为何仍会把推理带偏。

相关信息

本期 Newspaper 由 MAI-UI Team 出品,编辑 Panrong Tong & gpt-5.6-sol,审核 Yue Wang,欢迎反馈 & 交流:panrong.tpr@alibaba-inc.com

信息源smol.ai · Hugging Face Daily Papers

Skillspaper-craft-skills

消耗 token1,628,740 tokens

News

12 条重点 News · 按 Long-horizon、GUI、Agentic RL、Harness、Memory 排列

← 返回总览

要点速览

重点 News

Long-horizon Agents

OpenAI / 清华等高校 · 研究

Long-horizon Agents

Retained state helps execution, but longer budgets do not force strategic revision

本周两组结果把长任务中的“记住”和“改主意”明确拆开:保留推理状态与压缩可以显著提高执行效率,但增加经验、指导或推理预算,仍未自动产生中途重审战略的闭环。

状态保留的增益

OpenAI Developers 报告,在 ARC-AGI-3 上启用 retained reasoning 与 compaction 后,GPT-5.6 Sol 从 13.3% 提升到 38.3%,同时输出 token 约减少六倍。该结果说明长轨迹的有效状态管理可以让同一模型少做重复推理,并把有限上下文留给新的分支。

策略层仍然锁定

同期的后训练轨迹研究分析 1,338 条公开运行、5,111 次训练,发现不同 Agent 往往在开局选定 Full SFT 或 PEFT,此后只在局部参数、数据与轮次上微调。论文把执行能力和策略修订能力分开,避免用最终分数掩盖搜索空间没有变化。

机制为何不等价

压缩、日志与经验库解决的是可访问性:当前步骤能否重新取得先前证据。战略修订还需要显式比较替代假设、识别平台期,并允许推翻已经投入大量预算的路线。前者降低重复成本,后者要求运行时主动制造反事实并承担切换成本。

重要性与影响

对长时 Agent,下一阶段的关键指标不应只有任务完成率和 token 数,还要记录首次战略、改变次数、改变触发证据与改变后的净收益。产品侧可把保留状态视为基础设施,把战略审查设成独立的阶段门;两者同时存在,才可能把更长预算变成更深搜索。

Qwen / Unsloth · 系统实测

Long-horizon Agents

Qwen3.8-27B turns a 27B model into a local Agent system experiment

Qwen3.8-27B 的一周不是一条榜单新闻,而是一场围绕量化、上下文、解码器、提示模板和硬件拓扑的系统实验;同一权重既出现接近前沿的本地 Agent 信号,也暴露知识回忆、延迟与评测饱和问题。

能力信号分层

Artificial Analysis 的聚合排名、社区 21 题代码集和单文件游戏复刻并不测同一对象。前者提供跨模型位置,后两者更接近特定 harness 下的完成质量。报告保留这些结果的来源类型,不把小样本盲评或熟悉任务复刻升级为普遍能力结论。

量化不是单一旋钮

Unsloth Dynamic v3 宣称同体积 top-1 准确率提高超过 10%,并给出从约 8GB 的一比特版本到 BF16 的梯度;社区同时要求补充旧版 UD 2.0、分领域 KLD 与 KV-cache 量化损失。这说明“能放进显存”只回答容量,不能回答长轨迹稳定性。

解码系统改变可用性

双 RTX 3090 的 DFlash2 报告把代码生成推到 218.3 tok/s,另一套单卡优化报告约 138 tok/s,并把缓存后的长对话续写延迟降到约一秒。数字来自不同硬件、量化与提示组合,真正可迁移的结论是 speculative drafting、prefix cache 与混合架构状态对 Agent 周转率很关键。

重要性与影响

27B 级模型开始让团队在本地做完整的模型–harness 联合优化,而不是只比较 API 价格。部署决策需要同时记录任务成功率、首次响应、每轮解码、总 token、知识闭卷表现和失败重试;缺少任一维度,都可能把快速但不可靠或准确但无法周转的系统误判为优选。

GUI / Computer / Mobile / Browser Use

DeepSeek · 模型发布

GUI / Computer / Mobile / Browser Use

DeepSeek-V4-Flash-Vision-Exp adds a low-cost native visual entry point

DeepSeek 在 V4 Flash 上开放原生视觉实验版本,把截图、文档与图像输入接入同一低价 API;更值得关注的不是单项榜单,而是视觉 token 定价和文件复用是否足以改变高频 GUI Agent 的单位任务成本。

发布事实

官方公告将 DeepSeek-V4-Flash-Vision-Exp 定位为实验性视觉能力,沿用 V4 Flash 的工具与推理接口。发布方报告 Agents’ Last Exam 27.3、ZeroBench Pass@5 35.0,并给出 Opus-4.8 的对照;这些数字应视为厂商测量,不等同于跨 harness 独立复现。

图像成本结构

官方说明单张图像最多折算 384 个输入 token,并支持经 Files API 重用已上传文件。对桌面 Agent,这一设计使相同截图或文档在多轮分析中不必重复上传,成本模型从“每轮重新编码整图”转向“文件生命周期加增量推理”。

GUI 评测仍需补齐

视觉问答与 GUI 完成率之间还隔着定位、动作、恢复和权限控制。低图像价格能够扩大轨迹采样,但只有在同一浏览器或桌面环境中固定分辨率、动作预算、重试与 verifier,才能判断视觉入口是否真的减少误点和回退。

重要性与影响

该版本为低成本、多截图 Agent 增加了新的底座选择,尤其适合文档审阅、网页巡检和证据截图复用。它也会推动评测从每百万 token 价格转向每个已验证 GUI 任务的总成本,包括截图数量、缓存命中、失败恢复和最终校验。

Google / Meta · 基准

GUI / Computer / Mobile / Browser Use

Gemini 3.7 Flash and Muse Spark move visual and office agents onto a cost frontier

Gemini 3.7 Flash 与 Muse Spark 1.2 同时把视觉、表格和前端生成拉入“质量–延迟–成本”三维竞争;本周的信号不是某个统一冠军,而是不同工作负载开始拥有各自的 Pareto 前沿。

办公分析证据

Artificial Analysis 的 AA-AnalystAgent 覆盖 80 个表格和文档型量化任务,Google 相关发布引用 Gemini 3.7 Flash 的 70.5% pass@1、77.5% pass@5、1.32 秒每题与 0.54 美元平均成本。应把通过率、重试收益、延迟与价格分开读。

视觉生成证据

Muse Spark 1.2 在 Agent Arena 报告净提升 2.1%,其中 Bash Recovery 提升 11.4%;Design Arena 又给出 Video-to-Website 第一、Image-to-HTML 第二和 Image-to-Frontend 第三。后者主要反映偏好与生成质量,不能直接推导为端到端 GUI 操作可靠。

推理榜单的另一坐标

ARC Prize 报告 Gemini 3.7 Flash 在 ARC-AGI-2 达 84.6%、约 0.25 美元每题,在 ARC-AGI-1 达 95.5%、约 0.12 美元每题。该证据强化的是低成本推理位置,与办公 Agent 的工具链稳定性仍是不同实验。

重要性与影响

采购与路由将更细粒度:文档分析、视觉前端、恢复性 shell 操作和抽象推理可能由不同模型承担。团队需要建立任务族级的质量与成本曲线,而不是用一个综合榜单统一路由;这也让 harness 侧的失败分类和回退策略成为核心资产。

Anthropic / OpenAI · 平台

GUI / Computer / Mobile / Browser Use

Computer use becomes a platform surface: sandboxes, history, skills, files, and collaboration

Computer use 正从单个工具升级为平台表面:隔离工作区、可回放历史、版本化技能、文件生命周期和协作上下文被组合进同一运行时,产品差异因此更多落在权限、恢复和证据链。

企业工作区

Vanta 展示 TrustVanta 在缺少 API 时使用计算机操作收集截图证据;LangChain 的 monday.com 案例强调 LangSmith Sandboxes 为 CSV 分析和地图生成提供隔离工作区。两者共同说明现实任务的价值常来自访问非结构化界面,但风险也集中在可见范围与副作用。

Claude 平台表面

Anthropic 宣布 computer use、browser tool、Skills API 和 Files API 进入 GA。Skills 提供版本化程序,Files 支持过期控制、500 RPM 和每组织 1TB;AG-UI 适配器把聊天线程映射到 managed session,并流式传递文本、工具调用与思考事件。

OpenAI 的活动状态

同期 OpenAI 产品更新把 Messages、Computer History、Record & Replay、Sites 和 PR 上下文放在持续工作流中。它们共同把任务历史从隐式对话扩展为可恢复的活动记录、页面产物与代码协作证据,便于中断后继续或对失败步骤复盘。

重要性与影响

GUI Agent 的平台门槛正在从能否点击转向能否安全恢复:权限应按沙箱、外部工具和最终提交分层,历史需要可搜索且可回放,技能与文件需要版本和过期策略。越多状态进入平台,越需要明确谁能修改、何时提交以及如何撤销。

Agentic RL / Training Infrastructure

OpenAI · 安全决策

Agentic RL / Training Infrastructure

OpenAI pauses frontier RL while monitoring and isolation catch up

OpenAI 对前沿强化学习训练按下暂停键,把“能力进展超过安全与对齐节奏”公开定义为训练门槛;这使监控、隔离和告警延迟从合规附件变成影响训练吞吐的系统约束。

已公开的事实

Sam Altman 的公开说明称模型进展极快,并重申当能力超过安全和对齐节奏时会采取行动。当前可确认的是暂停与判断原则;关于具体触发实验、监控开销和恢复时间的更多说法缺少同等强度的一手材料,应与正式事实分开。

为何 RL 更敏感

前沿 RL 会在长轨迹中主动搜索高奖励行为,能力变化可能在若干训练步内迅速显现。若监控只看最终奖励,就难以及时发现策略利用 verifier、绕过工具权限或产生新型自治行为;安全测量必须进入 rollout 和训练环路。

基础设施代价

更强隔离意味着额外的沙箱启动、网络策略、轨迹存储与人工升级路径;更细监控则增加日志体量、在线分类与告警确认。它们直接压低每小时有效 rollout 数,因此合理的系统指标应同时报告训练速度、被拦截轨迹、误报率和恢复时延。

重要性与影响

该事件把安全能力与训练能力绑定在同一关键路径。未来的 agentic RL 平台若不能证明轨迹可追溯、工具可隔离、异常可在预算内升级,即使算法与硬件足够快,也可能无法持续运行;安全工程由此成为可扩展训练的前置条件。

Z.ai / Ornith · 模型发布

Agentic RL / Training Infrastructure

GLM-5.3 and Ornith-1.5 make post-training systems the open-model battleground

GLM-5.3 与 Ornith-1.5 把开放模型竞争从参数规模转向后训练系统:同底座继续扩展长时环境与 RL,或让模型自生成任务、脚手架和 rollout,正在成为更直接的能力来源。

同底座的控制变量

Z.ai 相关讨论把 GLM-5.3 描述为相对 GLM-5.2 保持基础架构、总参数与激活参数不变,增加约一个月长时环境和 RL。Code Arena 的发布方数据把 GLM-5.3 Max 放到开放模型第二、总体第八的位置,但这仍需按具体 harness 与价格读取。

自生成训练经验

Ornith-1.5 以 9B dense、35B-A3B 和 397B MoE 三个版本发布,声称通过提出任务、生成 scaffold 和生产 RL rollout 完成自改进。官方列出 Terminal-Bench 2.1 86.1、SWE-Bench Verified 86 与 DeepSWE 56,均属于发布方测量。

社区对照防止过度概括

社区把 Ornith 35B-A3B 与 Qwen3.8-27B 对照,Qwen 在 Terminal-Bench、DeepSWE 和 HLE 无工具设置领先,Ornith 在 NL2Repo 领先并在 GPQA Diamond 持平。结果说明同一后训练配方并不会在所有任务族产生统一优势。

重要性与影响

开源竞争的护城河正在变成任务生成、环境质量、异步优化和 verifier,而不只是权重文件。评估新版本时应要求同底座消融、训练环境清单、rollout 规模与跨任务保持率;否则参数不变的进步仍可能只是评测分布的针对性适配。

Microsoft / vLLM · 训练系统

Agentic RL / Training Infrastructure

Miles, Agent Lightning, and IsoExec expose rollout correctness as infrastructure

从 Miles 的 CI 与可观察性,到 Agent Lightning 的多调用样本组装,再到 IsoExec 的训练–推理数值契约,本周三条线共同指出:Agentic RL 的瓶颈已从“能否采样”转向“采到的轨迹能否被忠实重算、归因和恢复”。

长 rollout 的工程表面

Miles 的发布讨论强调持续集成、运行监控与失败诊断,使长时 rollout 不再是训练作业里不可见的黑箱。真正有价值的不是多起一些 worker,而是能够区分环境启动、模型调用、工具执行、验证和奖励异常,并在中断后恢复可用样本。

Harnessed RL 的接口问题

Agent Lightning v1.0 指出 harness 掌握交互循环后,训练器只看到动态数量的请求–响应对。retokenization、样本合并、rollout 级 advantage、loss normalization 与调度任何一处定义含糊,都可能让相同奖励被错误分配;论文详情在 Papers 深读展开。

数值执行契约

vLLM 与 SkyRL 的 IsoExec 用统一执行契约固定 kernel、累积精度与归约顺序,并在 Qwen3.5-35B-A3B 的 8×H100、50 步实验中把平均 log-prob 差异降到接近零,代价约为 25% RL step 开销;短实验未观察到明显奖励增益。

重要性与影响

三者把可复现性拆成轨迹、样本和数值三层。若日志不能恢复真实调用、样本不能保留 rollout 结构、训练与推理不能对齐概率,更多数据只会扩大噪声。平台团队应把这三层校验作为训练上线 gate,并单独衡量其吞吐成本。

Harness / Orchestration

Agent Arena / AT&T · 路由

Harness / Orchestration

Evaluation and enterprise routing converge on end-to-end task economics

评测工具与企业路由在本周汇合到同一个单位:已验证任务的总成本。trace 级失败发现、Pareto 前沿与 AT&T 的混合模型案例,都在把模型单价降级为整个任务经济学的一部分。

从输出到错误簇

Hamel Husain 的 eval-skills 更新把模型输出和轨迹转成可标注失败模式与聚类审阅面,使团队能追踪失败来自路由、分解、工具、记忆还是 verifier。只有错误分类稳定,成本优化才不会把低价但高返工率的模型误判为优选。

Pareto 而非单榜

Agent Arena 基于超过 170 万个真实会话增加 cost-per-task 与类别过滤,把质量与价格画在同一前沿。该设计承认任务分布决定最佳模型,并鼓励报告已完成任务的成本,而不是把输入输出 token 价格直接当作业务价值。

AT&T 案例的归因方式

公开摘要称 AT&T 内部已有 40% AI 使用路由到开放模型,目标 60%–70%;编码成本下降 56%,质量下降约 2%,规模约 450 亿 token/日。由于当前记录是二手转述,数字应明确归因,不能当作可独立核验的全企业财务报表。

重要性与影响

企业路由器将同时需要任务分类、失败概率、重试成本、时延和风险等级。最强闭源模型可能保留在高难或高风险尾部,开放模型覆盖稳定的中间区间;真正的竞争优势来自持续校准路由阈值与回退链,而不是一次性选定默认模型。

UCL · 协调研究

Harness / Orchestration

1,902 runs reveal how multi-Agent teams actually coordinate

一项覆盖 1,902 次编程运行的研究,把 Agent、文件、消息、读写与 token 成本建成时间网络,显示团队规模、任务形状和文件策略会改变协调拓扑,而“指定一个协调者”并不会自动形成通信中心。

测量对象改变

研究不只记录最终是否通过测试,而把 Agent 和文件都作为节点,把消息、写入、读取作为带时间与成本的有向边。这样可以观察一次文件写入服务多个读取者、广播替代点对点消息,以及协调成本在任务早期或持续阶段的分布。

规模与任务形状

直接消息起初接近随团队规模平方增长,最大团队中因广播增加而趋缓。共享规范型任务形成高连接网络,流水线型任务围绕局部接口保持稀疏;这意味着同一个“多 Agent 数量”在不同任务上并不代表相同协调负载。

文件与协调者

在消息密集的八 Agent 工作中,强制共享文件可把输出 token 约降低 42%;当文件本来就是主要协调通道时,强制规则反而增加开销。指定 coordinator 没有形成稳定 hub,也没有可靠提高成功率,说明角色名称不能替代实际拓扑。

重要性与影响

多 Agent 产品需要按任务形状选择通信机制,并监测网络是否退化为介绍握手、重复广播或文件轮询。论文的正式方法、预注册和密封复现实验在 Papers 深读展开;产品案例只能作为采用背景,不能取代 1,902 次受控运行的证据。

TrueFoundry / DeepSeek · 运行时

Harness / Orchestration

Open Agent runtimes and serving systems become independent optimization layers

TrueForge、DeepSeek Harness 与 Agent serving 研究把运行时从模型附属品提升为独立优化层:插件生命周期、沙箱、会话事件流、缓存和非模型延迟,正在共同决定 Agent 的质量、成本与可迁移性。

开放生产 harness

TrueFoundry 发布 MIT 许可的 TrueForge,包含模型循环、MCP 工具、按需沙箱、子 Agent、审批、上下文压缩、会话持久化、API 与可嵌入 UI。其 14 题对照宣称同模型比 Claude Managed Agents 少约 30% token,换 GLM-5.2 后成本低约 75%;数字由发布方提供。

插件化内核

DeepSeek Harness 基于 Cordis,把模型、工具、技能、会话、沙箱、存储、loop、调度与 UI 都注册为插件,甚至 Agent loop 本身也可替换。所有模型可见内容进入 append-only session log,resume、fork、search 和 replay 共用事件流;该设计在 Blogs 深读结合源码展开。

Serving 的系统占比

AgentSysBench 将 Agent 工作负载与普通 LLM inference 分开,关注多轮调用、工具空隙、上下文增长、cache 命中和非模型 latency。其意义在于:即使模型端 tokens/s 不变,session 调度、状态存取与沙箱等待也会改变每个完成任务的周转率。

重要性与影响

开放 runtime 使模型可替换,但可移植性仍取决于事件格式、插件接口、权限模型和外部服务。团队应把 harness 与 serving 分别做版本化和回归测试,记录模型外时间、上下文重写与 cache 行为;否则模型升级或插件替换可能悄悄破坏此前可靠的流程。

Memory / Continual Learning

南京大学 / Salesforce · 记忆研究

Memory / Continual Learning

Memory systems need calibrated retrieval and guarded updates, not just more stored text

本周的记忆研究共同否定“存得更多就会持续变好”:检索可能淹没当前证据,技能池会降低实际使用精度,未经保留测试的 harness 更新还会放大方差、任务顺序偏差和错误程序。

检索努力需要校准

Weaviate 相关讨论重提 Drowning in Documents、phantom hits 和 listwise reranking:扩大候选集会增加看似相关但无帮助的文档。更合理的系统需要按查询预测检索努力,并用分层打分或停止条件限制上下文,而不是固定取更多条目。

技能不等于事实注入

Demystifying Agent Skills 的受控实验把 65.7% 有效案例归为 procedural anchoring,显式知识注入仅 4.5%;候选池从 5 扩到 100 时,实际使用精度从 29.6% 降到 3.3%。因此技能库的触发与适配,和技能内容本身同样关键。

更新必须经过保留测试

Harness Continual Learning 把 task interface、experience memory、capability map 与 router 联合版本化,并让优化器只提出候选,由 evaluator 检查当前提升、历史保持和有效性后提交。另一项负结果则显示自改进方法在 24 个设置中的 17 个增加方差,且打乱任务顺序常显著退化。

重要性与影响

记忆系统需要 proposal、evaluation、commit 三段式治理:先生成候选记忆或技能,再在当前任务和历史任务上复验,最后才写入可见状态。Native memory 的训练愿景只有与检索校准、版本回滚和顺序随机化评测结合,才可能避免把偶然成功固化为长期偏差。

News 附录

  1. ReasonMaxxer 把 RL 增益解释为少数决策点上的策略修正

    论文与社区讨论认为,推理 RL 主要改变约 1%–3% 的 token 位置,并集中在高熵分支;ReasonMaxxer 尝试用少量基础模型 rollout 与对比选择复现这类增益。由于“被提升 token 总在 base model top-5”这一强断言仍受质疑,本期把论文留在略读,不升级为重点 News。

    arXiv:ReasonMaxxer 的稀疏策略修正假设与实验社区讨论:top-5 断言与约千倍算力主张的争议
  2. Sparse-MoE 的训练与解码优化继续下沉到架构层

    Nemotron 3.5 Lightning 把 30B 总参数、3B 激活参数与多 token 预测结合,另一条研究线讨论大 MoE 强化学习中的训练–推理错配。两者说明稀疏模型的有效 Agent 吞吐越来越依赖路由、draft 与概率一致性,但本周材料不足以形成同一设置下的完整对照。

    Chris Wolfer:Nemotron 3.5 Lightning 的稀疏激活与多 token 预测Ashwinee Panda:大 MoE 强化学习的训练–推理一致性实验
  3. 预训练方差不只来自随机种子和数据顺序

    Quantifying Pretraining Variance 指出,浮点运算顺序与分片差异造成的运行间波动,可能接近初始化和数据顺序等常见来源。它直接影响 scaling law 与消融实验的解释,但本周只有研究摘要和作者讨论,尚不足以重构为重点 News。

    Stefan Frei:Quantifying Pretraining Variance 的核心结果
  4. Cursor 把 Git 仓库副本改造成可丢弃缓存

    Cursor 的 Continuity 以对象存储上的线性化 WAL 为真相源,让本地 NVMe Git 副本按负载创建或回收,并将读副本扩展到大量并发 Agent。它是 coding-agent 后端的重要系统设计,但属于工程 Blog,正文细节放在 Blogs 略读。

    Cursor Engineering:Git at any scale 的 WAL、对象存储与读副本设计
  5. 检索系统开始分别优化召回规模、过滤图和多向量交互

    Weaviate 讨论检索过多导致 phantom hits 与 rerank 退化,Qdrant 把过滤连接写入 HNSW,Sentence Transformers 6.0 则强化 token 级多向量检索。三条材料共同指向按查询选择检索努力,但本周没有统一数据集与系统成本对照。

    Weaviate:Drowning in Documents 与检索级联Qdrant:filterable HNSW 与 ACORN 的发布方基准Sentence Transformers:v6.0 的多向量检索接口
  6. 推理解码微基准继续刷新,但缺少统一任务级复验

    DFlash 2、XuanTie C950 与多卡本地部署分别给出更高 tok/s 或更低延迟,却使用不同量化、上下文、硬件拓扑与提示负载。这些结果适合发现解码与内存布局线索,不适合直接排列 Agent 生产效率。

    DFlash 2:Qwen3.8-27B 在 M5 Max 上的发布方吞吐社区复验诉求:XuanTie C950 的上下文、prefill 与量化缺口

Blogs

3 篇深读 · 2 篇略读

← 返回总览

要点速览

01 · 深读

Introducing TrueForge: the open-source agent harness we run in production

核心 takeaway:文章最有价值的地方不是“开源优于闭源”的口号,而是把模型循环、上下文、沙箱、审批、MCP、会话与 UI 作为同一生产系统交付,并给出 14 个任务上的同条件对照。由此可以进一步拆解成本究竟来自模型选择、token 使用、沙箱生命周期还是运行时调度。

1. 论点从运行时开始

TrueFoundry 把模型定义为容易替换的推理组件,把真正决定任务能否落地的循环、工具执行、长上下文管理、危险动作审批和断线恢复放到 harness。这个划分比传统“Agent framework”更接近生产责任:模型提出动作,运行时决定动作何时执行、在哪个边界执行,以及失败后留下什么状态。

2. 三层产品结构

TrueForge 由核心 server、TypeScript SDK/API 和可嵌入 UI 组成。核心 server 流式记录每一步,敏感动作可暂停等待批准,subagent 与 compaction 控制上下文,session 在重新连接后继续;SDK 与 UI 只是同一状态机的不同入口,避免产品界面与后端 Agent 语义各自演化。这个分层还让部署方可以单独替换交互界面或模型 provider,而不改变会话记录、审批和工具执行的语义。

3. 按需沙箱的经济性

文章强调沙箱是一种工具,而不是整段会话永远驻留的容器。只有执行代码时才创建临时环境,普通模型轮次不占用沙箱资源;这把隔离安全和并发密度同时放入架构。源码中 sandbox provider、tool loop 和 session 模块相互分离,也支持把本地、容器或第三方执行后端替换。

4. 14 题对照怎样读

发布方在相同任务上与 Claude Managed Agents 比较,声称同用 Opus 4.8 时质量相当且 token 少约 30%,换用 GLM-5.2 时准确率保持而成本低约 75%。由于样本只有 14 个生产风格任务,且任务定义、失败处理与计价均由发布方控制,适合证明 harness 可能影响成本,不足以给出普遍排名。

5. 治理不应被混入定义

自托管模式把模型和 MCP 密钥交给部署方;团队扩大后,TrueFoundry Gateway 再提供 RBAC、预算、guardrail、凭证轮换与统一 trace。这个边界使 Agent 定义可以引用模型和工具名称而不携带密钥,也说明开放 harness 解决可见性和可改性,跨团队治理仍是独立系统问题。

6. 源码审计后的判断

本期固定的官方仓库提交展示 monorepo 中 server、web、SDK、UI、provider 与部署目录,确实不是只有 README 的发布。更重要的影响是接口可成为公共基准:模型、MCP 和 sandbox 通过可替换 provider 接入,企业可以在不重写 Agent 产品的情况下做成本路由;但仍应为每次 runtime 升级保留回归轨迹。

重要性与影响:开放的是完整运行时而非示例框架,核心价值在可替换模型、按需沙箱、会话持久化和可审计审批。

02 · 深读

DeepSeek Harness developer preview: Everything is a plugin

核心 takeaway:DeepSeek Harness 的关键不是功能数量,而是把运行时的所有能力都降格为可注册、可卸载、可替换的插件,并让同一 append-only session event stream 支撑恢复、分叉、搜索和回放。该设计把 Agent loop 本身也纳入配置与依赖图,提供很强的实验可组合性;代价是插件 API、依赖顺序和事件语义一旦变化,整个系统的可复现性都需要重新验证。

1. Cordis 内核的边界

官方页面把 Cordis 描述为负责 plugin mount、unmount 与依赖的 kernel。模型、工具、skills、sessions、sandboxes、storage、loops、scheduling 和 UI 不直接写死在主程序,而通过 service 与 event 协作。运行时因此更像一个能力容器,预设只是把插件及其配置组合成可启动图。这个边界的实际意义是,插件拿到的是显式服务与事件,而不是通过修改全局单例偷偷扩展能力。

2. 连循环也能替换

大多数 Agent 框架允许增加工具,却把 plan–act–observe 循环固定在内核。DeepSeek Harness 把 loop 也作为插件,意味着相同的模型、存储和工具可以在 standard、code、minimal 或自定义模式中复用。对研究而言,这使控制流成为显式实验变量;对生产而言,也扩大了需要回归测试的状态空间。

3. 事件流作为单一事实源

所有模型可见内容进入 append-only session log,包括 system prompt、reasoning、tool call/result、subagent scheduling 与 context injection。Trajectory 视图按来源检查记录,resume、fork、search 和 replay 使用同一事件流。与只保存聊天文本相比,这能解释一次上下文重写或调度选择如何改变后续动作,也让恢复时可以区分已经执行的副作用、仅生成的计划与后来注入的上下文。

4. 四种运行模式的目的

Standard 暴露完整编码工具;Code mode 让模型生成 TypeScript 程序编排多轮工具;Minimal 只保留 shell 与文件编辑器,适合减少 harness 干扰的模型基准;Creator 则允许在内存中检查和试装插件。它们不是四个产品,而是同一插件图对不同评测目标的约束。

5. 源码中的可逆注册

官方仓库把插件定义、service 注入、event 订阅和 preset 配置分层,架构文档明确要求 dispose 路径撤销注册,避免热加载后遗留能力。会话与存储实现围绕事件追加而非覆盖当前转录,这与页面宣传的 replay 语义一致;审计仍不代表所有第三方插件都满足相同约束。

6. 工程影响

插件化把“换模型”扩展到“换整个控制面”,适合快速比较 loop、工具策略和 memory。相应地,生产系统需要锁定插件版本、依赖解析和 event schema,并对卸载、失败恢复与重放做确定性检查。developer preview 意味着核心 API 仍可能变化,当前更适合作为开放实验运行时而非无条件稳定标准。

重要性与影响:Cordis 把模型、工具、会话、调度乃至 Agent loop 都变成可挂载插件,并用 append-only event stream 提供追踪与回放。

03 · 深读

Gisting: Compressing LLM Agent context to ↑ throughput and ↓ cost

核心 takeaway:Shopify 的 Gisting 把约 6,000 token 的静态系统提示压成约 1,500 个可学习 gist token,模型权重保持冻结,并通过 teacher–student KL 匹配保留输出分布。在 350 RPM 的负载测试中,发布方报告 TTFT 下降 19%、端到端延迟下降约 38%、吞吐提高 16%,最终少用约 14% GPU。它说明 prefix cache 仍无法消除每个解码 token 读取长 KV 的成本,短前缀本身具有独立价值。

1. 问题是静态前缀税

Agent 系统提示往往包含工具规则、业务约束与输出规范,每次请求都携带数千 token。Prefix cache 可以避免重复 prefill,却不能让新生成 token 不再注意这些 KV;解码时读取的缓存仍随前缀长度线性增长,因此高并发和大 batch 下,长静态前缀持续占用显存带宽。

2. 蒸馏对象不是模型权重

方法给词表加入特殊 gist token,只训练其 embedding。Teacher pass 使用完整自然语言提示产生每个响应位置的 logits,student pass 用 gist token 替换提示,最小化两组 logits 的 KL divergence。模型其余参数冻结,所以训练目标是让短前缀触发与长提示接近的条件分布。

3. 部署路径保持普通

训练结束后,gist embedding 直接写入模型 embedding matrix,并把 token 注册到 tokenizer。推理只需把完整系统提示替换成 gist token 字符串,不需要自定义 attention mask、额外 encoder 或专门 serving 引擎。一次性训练成本换取后续每个请求的前缀缩短,也让现有 batcher、prefix cache 与监控链路无需理解新的中间表示。

4. 超参搜索给出的工程结论

Shopify 用 autoresearch loop 提议配方、训练并评测。把系统提示按压缩比例分块,并用块内 token embedding 均值初始化对应 gist,使初始 loss 降低七倍;在其业务上 4:1 是质量开始退化前的最优点。预计算 teacher logits 与预分词又把完整训练从约 30 小时降到 6 小时。

5. 负载证据

系统提示由约 6,000 压到 1,500 token。在 350 RPM,median TTFT 从 438ms 降到 354ms,端到端从 6.8s 降到 4.2s,吞吐由 20.2 升到 23.4 QPS;文章概括为 TTFT 下降 19%、E2E 下降约 38%、吞吐提高 16%,生产配置少用约 14% GPU。这组结果同时覆盖请求延迟、吞吐与容量规划,比单独比较 prefill token/s 更接近线上收益。它也表明节省主要发生在持续解码和并发调度,而不只是在首轮提示预填充。

6. 适用条件与影响

Gisting 最适合长且稳定、质量可用任务级 judge 检查的系统提示。提示频繁变化、需要逐字审计或跨模型复用时,gist 需要重新训练且可解释性较弱。它与 prefix caching 可以叠加,并能在持续学习中把 gist 与模型权重一同更新;版本与回归集因此必须同步管理。

重要性与影响:冻结模型权重,只训练一组 gist embedding 复现长系统提示的行为,在生产负载中同时缩短 TTFT、解码延迟和 GPU 数量。

04 · 略读

Git at any scale

核心 takeaway:Cursor 不再把一台 Git server 上的仓库目录当作权威状态,而是用对象存储中的线性化 WAL 保存每次引用更新,把本地 NVMe 副本降为可重建缓存。这样可以让读副本随 Agent 负载扩缩,并把故障恢复从机器级复制改成日志重放。

1. 把写入顺序固定在 WAL

Continuity 先将 push 的引用更新序列化写入 S3 上的 WAL,再由本地 Git 副本应用对象与 refs。对象存储承担持久性,本地 NVMe 只负责低延迟读写;副本丢失后从快照和日志恢复,不需要把某台机器视为不可替代的仓库主节点。

2. Agent 负载改变副本经济性

大量并行 coding Agent 会制造短生命周期分支、clone、fetch、PR 与 CI 读取。Cursor 让热点仓库扩展读副本、冷仓库不常驻完整副本,并报告单仓库每秒 120/300 次 push 与上百读副本的测试。真正可迁移的判断是按访问热度配置副本,而不是照搬这些吞吐数字。

重要性与影响:Continuity 用 S3 上的线性化 WAL 作为真相源,把本地 NVMe Git 副本视为可丢弃缓存;读副本可按负载扩到上百个,空闲小仓库甚至无需常驻副本。该架构直接回应 Agent 造成的大量临时仓库、PR 与 CI 流量,但 120/300 pushes/s 和百副本线性扩展均是 Cursor 的系统测量。

05 · 略读

IsoExec: Unified Execution to Eliminate Trainer-Inference Mismatch in SkyRL

核心 takeaway:IsoExec 把训练–推理一致性定义为一套可执行的数值契约:相同算子、累积精度与固定归约顺序必须跨 vLLM rollout 和 Megatron trainer 保持一致。它把 log-prob 偏差压到接近零,但也明确展示了约四分之一训练步开销。

1. 统一的不是 API,而是数值路径

仅让训练器和推理引擎使用相同权重与 tokenizer,仍会因为 kernel、累积精度和并行归约顺序不同而产生概率偏差。IsoExec 让两侧遵循同一 execution contract,并以固定二叉归约树保持并行拓扑变化时的运算次序。

2. 一致性收益需要单独计价

在 Qwen3.5-35B-A3B、8×H100 与 50 个 RL step 的实验中,平均 log-prob 差异从 4.035×10⁻² 降至 6.821×10⁻⁷,step 时间约增加 25%;短实验未观察到明显 reward 增益。因此它首先是正确性与可诊断性基础设施,还不是已证明提高最终奖励的算法。

重要性与影响:IsoExec 用跨框架执行契约与并行拓扑不变 kernel 对齐 vLLM rollout 和 Megatron trainer;发布方报告平均 log-prob 差异由 4.035×10⁻² 降至 6.821×10⁻⁷,RL step 约增加 25%,而 50 步短实验未见明显 reward 增益。

Papers

Hugging Face Daily Papers Top50 · 17 篇深读 · 17 篇略读

← 返回总览

要点速览

Long-horizon Agents

GUI / Computer / Mobile / Browser Use

Agentic RL / Training Infrastructure

Harness / Orchestration

Memory / Continual Learning

    Long-horizon Agents · 深读

    StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

    核心亮点:StateM 把 runbook 变成 Agent 与运行时共同操作的显式控制面:状态边界刷新局部上下文,转移条件要求可审计证据,跨运行实践被版本化,从而把 harness scaling 作为独立能力轴。

    • 研究问题:在不更新模型权重时,持久状态、阶段化上下文、检查式转移与可恢复 runbook 能否把局部能力转化为长任务完成率,并跨模型与任务族迁移。
    • 核心 idea:StateM 把 runbook 变成 Agent 与运行时共同操作的显式控制面:状态边界刷新局部上下文,转移条件要求可审计证据,跨运行实践被版本化,从而把 harness scaling 作为独立能力轴。
    • 关键证据:GPT-5.5 xhigh:83.1% reference→92.1%;GPT-5.6 Sol xhigh:424/445,raw 95.28%;GPT-5.6 Luna:76.7%→85.4%;DeepSeek-V4-Flash:82.7%→88.1%,最终证据约 $15
    • 重要性与影响:StateM 把 runbook 变成 Agent 与运行时共同操作的显式控制面:状态边界刷新局部上下文,转移条件要求可审计证据,跨运行实践被版本化,从而把 harness scaling 作为独立能力轴。 该结果改变了 Long-horizon Agents 的评测或实现单位。

    来源:HF Papers 2608.15089 · arXiv 2608.15089

    展开深度解读
    issue21-w34-p01-2608.15089-concise.html新窗口打开

    Long-horizon Agents · 深读

    Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    核心亮点:论文用 Solution Framing、Execution、Feedback Control 三段过程指标和受控经验对照补足最终分数,得到的核心画像是:当前 Agent 更像工程优化器,能组合既有方法,但真正方法创新稀少。

    • 研究问题:长时研发 Agent 的最终分数相近时,过程瓶颈、经验复用、运行方差和 harness 差异如何被拆开测量。
    • 核心 idea:论文用 Solution Framing、Execution、Feedback Control 三段过程指标和受控经验对照补足最终分数,得到的核心画像是:当前 Agent 更像工程优化器,能组合既有方法,但真正方法创新稀少。
    • 关键证据:Opus overall avg@3 0.739,best@3 0.790;7 模型×36 任务×3 rollouts;intra-task 对照聚合 3,232 条 retained trajectories;252 个 best-of-three 方案仅 3 个经人工复核为 novel
    • 重要性与影响:论文用 Solution Framing、Execution、Feedback Control 三段过程指标和受控经验对照补足最终分数,得到的核心画像是:当前 Agent 更像工程优化器,能组合既有方法,但真正方法创新稀少。 该结果改变了 Long-horizon Agents 的评测或实现单位。

    来源:HF Papers 2608.13417 · arXiv 2608.13417

    展开深度解读
    issue21-w34-p02-2608.13417-concise.html新窗口打开

    Long-horizon Agents · 深读

    How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

    核心亮点:AutoResearchEval 保存完整代码、数据、日志与报告,再用 artifact-aware judge 把 45 种失败映射到 grounding、认知适应、完整性与工程稳健四个根因;结果把许多表面不同的错误归结为缺少显式元认知重规划。

    • 研究问题:科研 Agent 从选题到写作的六阶段轨迹中,失败如何定位到具体工件、阶段和根因,而不是只用最终指标判定输赢。
    • 核心 idea:AutoResearchEval 保存完整代码、数据、日志与报告,再用 artifact-aware judge 把 45 种失败映射到 grounding、认知适应、完整性与工程稳健四个根因;结果把许多表面不同的错误归结为缺少显式元认知重规划。
    • 关键证据:100 tasks、7 domains、800 trajectories;pattern-level κ:0.53→0.75;taxonomy κ:0.62→0.83;45 failure patterns、4 root-cause pillars
    • 重要性与影响:AutoResearchEval 保存完整代码、数据、日志与报告,再用 artifact-aware judge 把 45 种失败映射到 grounding、认知适应、完整性与工程稳健四个根因;结果把许多表面不同的错误归结为缺少显式元认知重规划。 该结果改变了 Long-horizon Agents 的评测或实现单位。

    来源:HF Papers 2608.14905 · arXiv 2608.14905

    展开深度解读
    issue21-w34-p03-2608.14905-concise.html新窗口打开

    Long-horizon Agents · 深读

    What is Missing from AI Post-Training AI: An Empirical Analysis

    核心亮点:论文把 execution-level capability 与 strategy-level capability 分开,并通过经验、人工指导和额外推理预算逐级干预;三者都能改善局部执行,却没有补出运行中的自发战略重审机制。

    • 研究问题:能完整执行后训练流程的 Agent,是否会在实验反馈表明路线受限时主动重选训练范式、数据源或阶段结构。
    • 核心 idea:论文把 execution-level capability 与 strategy-level capability 分开,并通过经验、人工指导和额外推理预算逐级干预;三者都能改善局部执行,却没有补出运行中的自发战略重审机制。
    • 关键证据:1,338 trajectories、5,111 trainings、1,104 checkpoints;总体 observed gain:10.41%→23.0%;Claude Full SFT 初始占 80.7%;Codex PEFT 初始占 89.6%
    • 重要性与影响:论文把 execution-level capability 与 strategy-level capability 分开,并通过经验、人工指导和额外推理预算逐级干预;三者都能改善局部执行,却没有补出运行中的自发战略重审机制。 该结果改变了 Long-horizon Agents 的评测或实现单位。

    来源:HF Papers 2608.19072 · arXiv 2608.19072

    展开深度解读
    issue21-w34-p04-2608.19072-concise.html新窗口打开

    GUI / Computer / Mobile / Browser Use · 深读

    UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

    核心亮点:UI-Mate 将 environment-grounded 数据飞轮、SFT/RL 训练与 in-context demonstration 结合;示范被分割为带完成条件的子任务,而不是坐标轨迹回放,使 Agent 能在 live UI 上遵循意图并重新规划。

    • 研究问题:开放 GUI Agent 能否同时解决训练分布不足和运行时指令歧义,并把人类示范转成可适应实时界面的子任务流程。
    • 核心 idea:UI-Mate 将 environment-grounded 数据飞轮、SFT/RL 训练与 in-context demonstration 结合;示范被分割为带完成条件的子任务,而不是坐标轨迹回放,使 Agent 能在 live UI 上遵循意图并重新规划。
    • 关键证据:OSWorkerBench:100 long-horizon tasks、41 apps;33 个 same-task self demos;45 个 related-task human variant demos;UI-Mate-27B 为开放权重 GUI Agent 提供新结果
    • 重要性与影响:UI-Mate 将 environment-grounded 数据飞轮、SFT/RL 训练与 in-context demonstration 结合;示范被分割为带完成条件的子任务,而不是坐标轨迹回放,使 Agent 能在 live UI 上遵循意图并重新规划。 该结果改变了 GUI / Computer / Mobile / Browser Use 的评测或实现单位。

    来源:HF Papers 2608.15930 · arXiv 2608.15930

    展开深度解读
    issue21-w34-p05-2608.15930-concise.html新窗口打开

    Agentic RL / Training Infrastructure · 深读

    EnvHarness: Awakening Static Worlds for Agent Learning

    核心亮点:EnvHarness 仿照 Agent harness,把 Bridge、Contract 与 Dynamics 叠加在标准环境接口外部;EnvRigger 读取失败轨迹生成可执行组件,使静态任务变成能随策略弱点调整的学习环境。

    • 研究问题:不修改静态 benchmark 内部代码,能否通过外部 wrapper 为其加入动作、记忆、反馈与课程,使同一环境持续生成可训练经验。
    • 核心 idea:EnvHarness 仿照 Agent harness,把 Bridge、Contract 与 Dynamics 叠加在标准环境接口外部;EnvRigger 读取失败轨迹生成可执行组件,使静态任务变成能随策略弱点调整的学习环境。
    • 关键证据:同一框架覆盖七种环境;跨五个 benchmark 评估 skill transfer;SWE-bench Verified 展示 environment scaling;组件代码在 episode 子进程执行,隔离故障
    • 重要性与影响:EnvHarness 仿照 Agent harness,把 Bridge、Contract 与 Dynamics 叠加在标准环境接口外部;EnvRigger 读取失败轨迹生成可执行组件,使静态任务变成能随策略弱点调整的学习环境。 该结果改变了 Agentic RL / Training Infrastructure 的评测或实现单位。

    来源:HF Papers 2608.19880 · arXiv 2608.19880

    展开深度解读
    issue21-w34-p06-2608.19880-concise.html新窗口打开

    Agentic RL / Training Infrastructure · 深读

    Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements

    核心亮点:Agentic ESOpt 对参数采样成对扰动,以整条轨迹奖励加权更新,并用 cosine schedule 缩小扰动;它把 full-parameter adaptation 降到推理级显存,还能与 Trace2Skill 等 prompt-space 进化组合。

    • 研究问题:长时稀疏奖励下,黑盒 evolution strategies 能否用推理级显存完成全参数 Agent 微调,并避免逐 token credit assignment。
    • 核心 idea:Agentic ESOpt 对参数采样成对扰动,以整条轨迹奖励加权更新,并用 cosine schedule 缩小扰动;它把 full-parameter adaptation 降到推理级显存,还能与 Trace2Skill 等 prompt-space 进化组合。
    • 关键证据:27B web agent 可在 4×H100 80GB 上全参数适配;Sudoku 以三次评估报告均值与标准差;比较 PPO、两种 GRPO 与 Vanilla ES;Math/DocVQA 的所有匹配 Pass@4 指标超过 GRPO
    • 重要性与影响:Agentic ESOpt 对参数采样成对扰动,以整条轨迹奖励加权更新,并用 cosine schedule 缩小扰动;它把 full-parameter adaptation 降到推理级显存,还能与 Trace2Skill 等 prompt-space 进化组合。 该结果改变了 Agentic RL / Training Infrastructure 的评测或实现单位。

    来源:HF Papers 2608.17310 · arXiv 2608.17310

    展开深度解读
    issue21-w34-p07-2608.17310-concise.html新窗口打开

    Agentic RL / Training Infrastructure · 深读

    SPADE: Self-Play in Adaptive Synthetic Executable Environments

    核心亮点:SPADE 让 Environment Designer 生成完整 Gym-style MDP 与 privileged hint,再以 Agent 有无 hint 的回报差奖励设计者;共享 policy 因此同时学习造题与解题,课程随能力变化而移动。

    • 研究问题:单一 LLM 能否同时扮演环境设计者和解题 Agent,用可执行环境与 hint regret 持续生成位于能力边缘的训练目标。
    • 核心 idea:SPADE 让 Environment Designer 生成完整 Gym-style MDP 与 privileged hint,再以 Agent 有无 hint 的回报差奖励设计者;共享 policy 因此同时学习造题与解题,课程随能力变化而移动。
    • 关键证据:30B games setting:八基准平均较 fixed-env 强基线 +5.3;BFCL v4 multi-turn +5.7;ACEBench-Agent +13.9;30B games 平均 50.2→58.3
    • 重要性与影响:SPADE 让 Environment Designer 生成完整 Gym-style MDP 与 privileged hint,再以 Agent 有无 hint 的回报差奖励设计者;共享 policy 因此同时学习造题与解题,课程随能力变化而移动。 该结果改变了 Agentic RL / Training Infrastructure 的评测或实现单位。

    来源:HF Papers 2608.19197 · arXiv 2608.19197

    展开深度解读
    issue21-w34-p08-2608.19197-concise.html新窗口打开

    Agentic RL / Training Infrastructure · 深读

    Agent Lightning v1.0: Towards Harnessed Agentic RL

    核心亮点:Agent Lightning v1.0 把 harness state 纳入潜在 POMDP,并把 rollout 展开为动态数量的 request–response samples;论文系统化定义 retokenization、merge、advantage、normalization 与 collocated async scheduling。

    • 研究问题:当 deploy-time harness 而非训练框架掌握交互循环时,动态模型调用如何重组为正确、稳定且可调度的 RL 样本。
    • 核心 idea:Agent Lightning v1.0 把 harness state 纳入潜在 POMDP,并把 rollout 展开为动态数量的 request–response samples;论文系统化定义 retokenization、merge、advantage、normalization 与 collocated async scheduling。
    • 关键证据:完整实验覆盖 search、instruction 与 coding agents;文本前缀相同不保证 tokenizer token 前缀相同;一个 rollout 可产生动态数量训练样本;论文展示 rollout-level normalization 对 coding 稳定性
    • 重要性与影响:Agent Lightning v1.0 把 harness state 纳入潜在 POMDP,并把 rollout 展开为动态数量的 request–response samples;论文系统化定义 retokenization、merge、advantage、normalization 与 collocated async scheduling。 该结果改变了 Agentic RL / Training Infrastructure 的评测或实现单位。

    来源:HF Papers 2608.17528 · arXiv 2608.17528

    展开深度解读
    issue21-w34-p09-2608.17528-concise.html新窗口打开

    Agentic RL / Training Infrastructure · 深读

    LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

    核心亮点:LEGO-RL 用 in-process LLM proxy 捕获原始生成流,以 trainer-side recomputation 和 routing replay 保持概率一致;再用镜像缓存、分阶段权限和 Live UI 把执行可靠性与训练诊断纳入同一闭环。

    • 研究问题:不改写原生 coding harness 控制流时,如何同时保证生成 token 对齐、沙箱与奖励完整性、异步训练和逐轨迹可观察性。
    • 核心 idea:LEGO-RL 用 in-process LLM proxy 捕获原始生成流,以 trainer-side recomputation 和 routing replay 保持概率一致;再用镜像缓存、分阶段权限和 Live UI 把执行可靠性与训练诊断纳入同一闭环。
    • 关键证据:OpenHands:64.0%→70.4%;Claude Code:62.4%→68.2%;OpenCode:57.2%→66.6%;三种 harness 的 rollout–training Pearson r≥0.9980
    • 重要性与影响:LEGO-RL 用 in-process LLM proxy 捕获原始生成流,以 trainer-side recomputation 和 routing replay 保持概率一致;再用镜像缓存、分阶段权限和 Live UI 把执行可靠性与训练诊断纳入同一闭环。 该结果改变了 Agentic RL / Training Infrastructure 的评测或实现单位。

    来源:HF Papers 2608.17393 · arXiv 2608.17393

    展开深度解读
    issue21-w34-p10-2608.17393-concise.html新窗口打开

    Harness / Orchestration · 深读

    Demystifying Agent Skills: Why They Work—Until They Don’t

    核心亮点:8,135 次受控 trial 与配对轨迹显示,Skills 主要把噪声经验压成稳定程序,而不是补知识;检索准确率与最终成功又是不同变量,精确命中既非充分也非必要。

    • 研究问题:Skills 的收益来自知识注入、程序锚定还是检索偶然性,它们在候选池扩大和跨 harness 时为何失效。
    • 核心 idea:8,135 次受控 trial 与配对轨迹显示,Skills 主要把噪声经验压成稳定程序,而不是补知识;检索准确率与最终成功又是不同变量,精确命中既非充分也非必要。
    • 关键证据:Skills 比 Workflow Memory 平均 +6.06 points;procedural anchoring 65.7%;knowledge injection 4.5%;pool 5→100:实际使用 precision 29.6%→3.3%
    • 重要性与影响:8,135 次受控 trial 与配对轨迹显示,Skills 主要把噪声经验压成稳定程序,而不是补知识;检索准确率与最终成功又是不同变量,精确命中既非充分也非必要。 该结果改变了 Harness / Orchestration 的评测或实现单位。

    来源:HF Papers 2608.14036 · arXiv 2608.14036

    展开深度解读
    issue21-w34-p11-2608.14036-concise.html新窗口打开

    Harness / Orchestration · 深读

    SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

    核心亮点:SkillEvo 把多轮用户模拟从终点评测改成 feedback generator,使修订后的 Skill 能进入更深对话并暴露新缺陷;独立 governance 层则修复事实退化和结构膨胀,而不是只用总分拒绝候选。

    • 研究问题:Skill 自演化为何在少数轮次后停滞,怎样让多轮交互持续暴露缺陷并防止内容膨胀与事实退化。
    • 核心 idea:SkillEvo 把多轮用户模拟从终点评测改成 feedback generator,使修订后的 Skill 能进入更深对话并暴露新缺陷;独立 governance 层则修复事实退化和结构膨胀,而不是只用总分拒绝候选。
    • 关键证据:6 类云服务、9 个生产 Skills、98 reference files;TSR:30.0→81.8 四轮;比 self-reflection +23.0 points;比 single-turn QA +15.4 points
    • 重要性与影响:SkillEvo 把多轮用户模拟从终点评测改成 feedback generator,使修订后的 Skill 能进入更深对话并暴露新缺陷;独立 governance 层则修复事实退化和结构膨胀,而不是只用总分拒绝候选。 该结果改变了 Harness / Orchestration 的评测或实现单位。

    来源:HF Papers 2608.13120 · arXiv 2608.13120

    展开深度解读
    issue21-w34-p12-2608.13120-concise.html新窗口打开

    Harness / Orchestration · 深读

    When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding

    核心亮点:论文把 Agent 和文件共同建成时间网络,以 1,902 次受控运行表明:任务形状决定持续协调拓扑,文件能替代点对点消息但并非总是省成本,命名 coordinator 也不产生可靠 hub。

    • 研究问题:多 Agent coding 团队的通信网络如何随团队规模、任务结构、文件政策和 coordinator 角色变化。
    • 核心 idea:论文把 Agent 和文件共同建成时间网络,以 1,902 次受控运行表明:任务形状决定持续协调拓扑,文件能替代点对点消息但并非总是省成本,命名 coordinator 也不产生可靠 hub。
    • 关键证据:1,902 graded runs + 244 sealed runs;八 Agent 消息密集任务文件策略约省 42% 输出 token;chained task 消息增长 slope 1.92;coordinator 无可靠成功增益
    • 重要性与影响:论文把 Agent 和文件共同建成时间网络,以 1,902 次受控运行表明:任务形状决定持续协调拓扑,文件能替代点对点消息但并非总是省成本,命名 coordinator 也不产生可靠 hub。 该结果改变了 Harness / Orchestration 的评测或实现单位。

    来源:HF Papers 2608.16801 · arXiv 2608.16801

    展开深度解读
    issue21-w34-p13-2608.16801-concise.html新窗口打开

    Harness / Orchestration · 深读

    Harness Continual Learning: Continual Adaptation Beyond Model Parameters

    核心亮点:HCL 把 harness 视为四组件联合版本状态,并将候选生成与提交分离;Continual Evaluator 同时检查当前提升、历史保持和有效性,使 harness-level forgetting 成为可测且可调的稳定–可塑权衡。

    • 研究问题:冻结 foundation model 时,prompt、memory、skill 和 router 的连续更新如何积累新能力而不破坏历史行为。
    • 核心 idea:HCL 把 harness 视为四组件联合版本状态,并将候选生成与提交分离;Continual Evaluator 同时检查当前提升、历史保持和有效性,使 harness-level forgetting 成为可测且可调的稳定–可塑权衡。
    • 关键证据:ALFWorld:HCL 完成 50 tasks,Static plateau 15;累计环境动作 HCL 83、MemRL 88、MemP 91;text、multimodal、open-world 多设置相对基线超过 10%;retention budget b 可显式调整忘却
    • 重要性与影响:HCL 把 harness 视为四组件联合版本状态,并将候选生成与提交分离;Continual Evaluator 同时检查当前提升、历史保持和有效性,使 harness-level forgetting 成为可测且可调的稳定–可塑权衡。 该结果改变了 Harness / Orchestration 的评测或实现单位。

    来源:HF Papers 2608.19013 · arXiv 2608.19013

    展开深度解读
    issue21-w34-p14-2608.19013-concise.html新窗口打开

    Memory / Continual Learning · 深读

    MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

    核心亮点:MemTrapBench 不再只测存取准确率,而构造 reasoning fixation 与 belief distortion;五种 memory framework 在两类模型上都落后无记忆基线,AdaptiveMem 则在推理前显式提醒模型审查记忆适用性。

    • 研究问题:即便记忆真实且语义相关,它是否会通过推理定势或信念扭曲让当前任务比无记忆更差。
    • 核心 idea:MemTrapBench 不再只测存取准确率,而构造 reasoning fixation 与 belief distortion;五种 memory framework 在两类模型上都落后无记忆基线,AdaptiveMem 则在推理前显式提醒模型审查记忆适用性。
    • 关键证据:Gemini no-memory avg 85.16,最佳 memory 71.17;Qwen no-memory avg 81.83,最佳 memory 70.13;Task Boundary:no-memory 92.29,trap 31.05;memory 长度 25%→100% 时 36.03→31.05
    • 重要性与影响:MemTrapBench 不再只测存取准确率,而构造 reasoning fixation 与 belief distortion;五种 memory framework 在两类模型上都落后无记忆基线,AdaptiveMem 则在推理前显式提醒模型审查记忆适用性。 该结果改变了 Memory / Continual Learning 的评测或实现单位。

    来源:HF Papers 2608.20202 · arXiv 2608.20202

    展开深度解读
    issue21-w34-p15-2608.20202-concise.html新窗口打开

    Memory / Continual Learning · 深读

    MobileMem: Learning from a Year of Mobile Experiences

    核心亮点:MobileMem 用 KEME 从用户先验合成长时 app-session 轨迹与 QA,覆盖事实、多跳、时间、更新、偏好、拒答和视觉推理;结果显示强记忆系统仍在时间依赖、adversarial query 和成本上存在明显取舍。

    • 研究问题:移动端个人助理如何在跨应用、跨模态、持续变化的一年级时间轴上建立可检索又能更新的体验记忆。
    • 核心 idea:MobileMem 用 KEME 从用户先验合成长时 app-session 轨迹与 QA,覆盖事实、多跳、时间、更新、偏好、拒答和视觉推理;结果显示强记忆系统仍在时间依赖、adversarial query 和成本上存在明显取舍。
    • 关键证据:16 users、1,589 events;平均每用户 1.72M context tokens;155,670 dialogue turns、19,060 images;7,415 questions
    • 重要性与影响:MobileMem 用 KEME 从用户先验合成长时 app-session 轨迹与 QA,覆盖事实、多跳、时间、更新、偏好、拒答和视觉推理;结果显示强记忆系统仍在时间依赖、adversarial query 和成本上存在明显取舍。 该结果改变了 Memory / Continual Learning 的评测或实现单位。

    来源:HF Papers 2608.13606 · arXiv 2608.13606

    展开深度解读
    issue21-w34-p16-2608.13606-concise.html新窗口打开

    Memory / Continual Learning · 深读

    On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

    核心亮点:论文重新评估 AWM 与 RBank,发现更强无记忆 Agent 已消除多数平均增益,而 memory 在 71% 设置中增加方差、在打乱顺序时经常退化;欠约束 feedback 让 API 幻觉和替代算法被反复保存与检索。

    • 研究问题:记忆型自改进 Agent 的增益在更强 baseline、重复运行和随机任务顺序下是否仍成立,错误经验为何会被持续放大。
    • 核心 idea:论文重新评估 AWM 与 RBank,发现更强无记忆 Agent 已消除多数平均增益,而 memory 在 71% 设置中增加方差、在打乱顺序时经常退化;欠约束 feedback 让 API 幻觉和替代算法被反复保存与检索。
    • 关键证据:17/24 设置方差增加,约 71%;11 个设置相对方差增加超过 50%;打乱顺序后 8 个比较中 6 个显著退化;强 baseline:WebArena 54.8、VisualWebArena 54.9、SCUBA 49.6
    • 重要性与影响:论文重新评估 AWM 与 RBank,发现更强无记忆 Agent 已消除多数平均增益,而 memory 在 71% 设置中增加方差、在打乱顺序时经常退化;欠约束 feedback 让 API 幻觉和替代算法被反复保存与检索。 该结果改变了 Memory / Continual Learning 的评测或实现单位。

    来源:HF Papers 2608.18066 · arXiv 2608.18066

    展开深度解读
    issue21-w34-p17-2608.18066-concise.html新窗口打开

    Long-horizon Agents

    OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

    Long-horizon Agents · 略读

    • 贡献:让 perception、ideation、experiment 与 writeup 直接读取异质原始证据;36 个案例全部生成论文,直接感知相对 scalar-only 版本在 85% 配对判断中获胜。
    • 证据:让 perception、ideation、experiment 与 writeup 直接读取异质原始证据;36 个案例全部生成论文,直接感知相对 scalar-only 版本在 85% 配对判断中获胜。
    • 略读原因:范围宏大但案例少,适合观察科研工件链,不作为本期方法主线。

    来源:HF Papers 2608.13558 · arXiv 2608.13558

    Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

    Long-horizon Agents · 略读

    • 贡献:从 561 个行业筛出 20 个重型发现问题,用统一 task–environment–episode 与 HDS6 六维量表测工具、修复、替代方案、连贯性、证据和范围。
    • 证据:从 561 个行业筛出 20 个重型发现问题,用统一 task–environment–episode 与 HDS6 六维量表测工具、修复、替代方案、连贯性、证据和范围。
    • 略读原因:聚焦真实发现任务,证据跨领域且系统庞大,本期略读保留评价框架。

    来源:HF Papers 2608.11341 · arXiv 2608.11341

    ASI-Bench: At the Dawn of Artificial Superintelligence

    Long-horizon Agents · 略读

    • 贡献:60 个项目级科研任务逐步撤去方法指导;18 个 Agent–model 组合平均分从完整指导 50.91 降到自主选方法 26.62,显示方法选择仍依赖人类。
    • 证据:60 个项目级科研任务逐步撤去方法指导;18 个 Agent–model 组合平均分从完整指导 50.91 降到自主选方法 26.62,显示方法选择仍依赖人类。
    • 略读原因:31,000+ 小时构建很重要,但标题叙事宽于本期 harness 主线。

    来源:HF Papers 2608.17271 · arXiv 2608.17271

    SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

    Long-horizon Agents · 略读

    • 贡献:119 个科学软件任务来自 98 个仓库和 20 个领域;最佳 Agent pass@1 仍低于 50%,并揭示科学知识有时约束修复、有时造成 anchoring。
    • 证据:119 个科学软件任务来自 98 个仓库和 20 个领域;最佳 Agent pass@1 仍低于 50%,并揭示科学知识有时约束修复、有时造成 anchoring。
    • 略读原因:与 AutoResearch 失败诊断互补,因本期深读已覆盖更完整科研流程而略读。

    来源:HF Papers 2608.19799 · arXiv 2608.19799

    Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search

    Long-horizon Agents · 略读

    • 贡献:把生成模型与 Bayesian non-parametric reward surrogate 联合,使用经验更新的 uncertainty-aware value 指导候选提出、修订和选择。
    • 证据:把生成模型与 Bayesian non-parametric reward surrogate 联合,使用经验更新的 uncertainty-aware value 指导候选提出、修订和选择。
    • 略读原因:更偏开放式科学优化,和 Agent runtime 的连接较间接。

    来源:HF Papers 2608.15669 · arXiv 2608.15669

    PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

    Long-horizon Agents · 略读

    • 贡献:144 个 source-to-target 物理环境突变对要求 Agent 迭代修复代码;揭示 memory 会锚定早期方案,明确物理变化也未消除机制重设计瓶颈。
    • 证据:144 个 source-to-target 物理环境突变对要求 Agent 迭代修复代码;揭示 memory 会锚定早期方案,明确物理变化也未消除机制重设计瓶颈。
    • 略读原因:是长时适应的好负结果,但主题更专注物理 code evolution。

    来源:HF Papers 2608.14441 · arXiv 2608.14441

    GUI / Computer / Mobile / Browser Use

    Self-Supervised Visual On-Policy Distillation

    GUI / Computer / Mobile / Browser Use · 略读

    • 贡献:不给 teacher 额外特权,而是强增强 student 视图制造信息不对称;Qwen3.5-4B 六项视觉任务从 70.7% 升到 77.4%。
    • 证据:不给 teacher 额外特权,而是强增强 student 视图制造信息不对称;Qwen3.5-4B 六项视觉任务从 70.7% 升到 77.4%。
    • 略读原因:属于视觉 post-training 核心算法,GUI 执行链较短。

    来源:HF Papers 2608.14144 · arXiv 2608.14144

    MOSS-VL Technical Report

    GUI / Computer / Mobile / Browser Use · 略读

    • 贡献:通过 gated cross-attention 与实时语料让模型边看边说;视觉 token 不进入 decoded sequence,长视觉上下文下 TTFT 优势从 2.8× 扩到 5.1×。
    • 证据:通过 gated cross-attention 与实时语料让模型边看边说;视觉 token 不进入 decoded sequence,长视觉上下文下 TTFT 优势从 2.8× 扩到 5.1×。
    • 略读原因:实时感知重要,但与本期计算机操作平台线的动作和恢复不同。

    来源:HF Papers 2608.15045 · arXiv 2608.15045

    VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

    GUI / Computer / Mobile / Browser Use · 略读

    • 贡献:VWE-Bench 与 VibeWorlding-Gym 用 MCP 统一资产检索、编辑、渲染和物理/意图 verifier;前沿模型成功率仍低于 60%。
    • 证据:VWE-Bench 与 VibeWorlding-Gym 用 MCP 统一资产检索、编辑、渲染和物理/意图 verifier;前沿模型成功率仍低于 60%。
    • 略读原因:多模态环境与 RL 结合很强,3D worlding 场景较专门。

    来源:HF Papers 2608.15265 · arXiv 2608.15265

    Agentic RL / Training Infrastructure

    ClawGym II: Exploring Black-Box RL on Agent Harness

    Agentic RL / Training Infrastructure · 略读

    • 贡献:用 sandbox 并发 rollout、模型边界 proxy 和 prefix tree 重建动态调用,同时支持 PPO、GRPO 与混合 harness 训练。
    • 证据:用 sandbox 并发 rollout、模型边界 proxy 和 prefix tree 重建动态调用,同时支持 PPO、GRPO 与混合 harness 训练。
    • 略读原因:与 Agent Lightning/LEGO-RL 高度相关,深读名额优先给更完整接口和观测研究。

    来源:HF Papers 2608.16798 · arXiv 2608.16798

    Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

    Agentic RL / Training Infrastructure · 略读

    • 贡献:多个不共享参数的异质模型用 peer reward 共同训练;模型族、规模和重述样本的多样性减少相关错误与自奖励坍缩。
    • 证据:多个不共享参数的异质模型用 peer reward 共同训练;模型族、规模和重述样本的多样性减少相关错误与自奖励坍缩。
    • 略读原因:无标签协作训练有新意,但与 deploy-time harness 的关系较弱。

    来源:HF Papers 2608.17253 · arXiv 2608.17253

    Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

    Agentic RL / Training Infrastructure · 略读

    • 贡献:每个 reward 独立标准化,再按 batch-level 饱和度降低已解决目标权重,使梯度转向剩余空间;困难正确性在 15 次对照中 12 次胜过 GDPO。
    • 证据:每个 reward 独立标准化,再按 batch-level 饱和度降低已解决目标权重,使梯度转向剩余空间;困难正确性在 15 次对照中 12 次胜过 GDPO。
    • 略读原因:属于多奖励优化细节,保留关键机制即可。

    来源:HF Papers 2608.16072 · arXiv 2608.16072

    Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

    Agentic RL / Training Infrastructure · 略读

    • 贡献:ReasonMaxxer 相关研究把 RL 增益解释为从预训练已存在的稀疏策略中重新分配概率,而不是创造全新推理能力,提示 pass@k 与策略多样性应并读。
    • 证据:ReasonMaxxer 相关研究把 RL 增益解释为从预训练已存在的稀疏策略中重新分配概率,而不是创造全新推理能力,提示 pass@k 与策略多样性应并读。
    • 略读原因:讨论再度升温,但论文日期早于本周并已存在较多解读。

    来源:HF Papers 2605.06241 · arXiv 2605.06241

    SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

    Agentic RL / Training Infrastructure · 略读

    • 贡献:在共享文本 span 上对齐不同 tokenizer,并用 student-reference KL 与终止 token advantage mask 控制长答案漂移;Intern-S2-Preview 的 ProofBench 提升 21.2 分。
    • 证据:在共享文本 span 上对齐不同 tokenizer,并用 student-reference KL 与终止 token advantage mask 控制长答案漂移;Intern-S2-Preview 的 ProofBench 提升 21.2 分。
    • 略读原因:蒸馏机制扎实,但不是 Agent harness 主线。

    来源:HF Papers 2608.14277 · arXiv 2608.14277

    Harness / Orchestration

    SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

    Harness / Orchestration · 略读

    • 贡献:只有规范、编译和 live PLC runtime 行为全部通过才完成;动态行为把 baseline 22.4–31.4 与 SemaPLC 52.2 明显拉开。
    • 证据:只有规范、编译和 live PLC runtime 行为全部通过才完成;动态行为把 baseline 22.4–31.4 与 SemaPLC 52.2 明显拉开。
    • 略读原因:工业验证价值高,领域专门,略读保留“外部执行才算完成”的原则。

    来源:HF Papers 2608.18565 · arXiv 2608.18565

    FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

    Harness / Orchestration · 略读

    • 贡献:先重建 skills 的目标、依赖和约束,再实现并修复共享容器状态,使 instruction、solution 与 verifier 基于同一执行真相。
    • 证据:先重建 skills 的目标、依赖和约束,再实现并修复共享容器状态,使 instruction、solution 与 verifier 基于同一执行真相。
    • 略读原因:与 EnvHarness 的环境构造相邻,深读名额优先后者的自适应学习闭环。

    来源:HF Papers 2608.18580 · arXiv 2608.18580

    From LLM Inference to Agentic Workloads: Characterization and Implications for Serving Systems

    Harness / Orchestration · 略读

    • 贡献:AgentSysBench 把多轮模型调用、工具等待、上下文增长、缓存和 session 调度纳入 serving 测量,显示 tokens/s 不能代表每个 Agent 任务的完成吞吐。
    • 证据:AgentSysBench 把多轮模型调用、工具等待、上下文增长、缓存和 session 调度纳入 serving 测量,显示 tokens/s 不能代表每个 Agent 任务的完成吞吐。
    • 略读原因:作为 serving 系统基准保留,本文不展开为独立深读。

    来源:HF Papers 2608.15127 · arXiv 2608.15127