核心 takeaway:文章最有价值的地方不是“开源优于闭源”的口号,而是把模型循环、上下文、沙箱、审批、MCP、会话与 UI 作为同一生产系统交付,并给出 14 个任务上的同条件对照。由此可以进一步拆解成本究竟来自模型选择、token 使用、沙箱生命周期还是运行时调度。
1. 论点从运行时开始
TrueFoundry 把模型定义为容易替换的推理组件,把真正决定任务能否落地的循环、工具执行、长上下文管理、危险动作审批和断线恢复放到 harness。这个划分比传统“Agent framework”更接近生产责任:模型提出动作,运行时决定动作何时执行、在哪个边界执行,以及失败后留下什么状态。
2. 三层产品结构
TrueForge 由核心 server、TypeScript SDK/API 和可嵌入 UI 组成。核心 server 流式记录每一步,敏感动作可暂停等待批准,subagent 与 compaction 控制上下文,session 在重新连接后继续;SDK 与 UI 只是同一状态机的不同入口,避免产品界面与后端 Agent 语义各自演化。这个分层还让部署方可以单独替换交互界面或模型 provider,而不改变会话记录、审批和工具执行的语义。
3. 按需沙箱的经济性
文章强调沙箱是一种工具,而不是整段会话永远驻留的容器。只有执行代码时才创建临时环境,普通模型轮次不占用沙箱资源;这把隔离安全和并发密度同时放入架构。源码中 sandbox provider、tool loop 和 session 模块相互分离,也支持把本地、容器或第三方执行后端替换。
4. 14 题对照怎样读
发布方在相同任务上与 Claude Managed Agents 比较,声称同用 Opus 4.8 时质量相当且 token 少约 30%,换用 GLM-5.2 时准确率保持而成本低约 75%。由于样本只有 14 个生产风格任务,且任务定义、失败处理与计价均由发布方控制,适合证明 harness 可能影响成本,不足以给出普遍排名。
5. 治理不应被混入定义
自托管模式把模型和 MCP 密钥交给部署方;团队扩大后,TrueFoundry Gateway 再提供 RBAC、预算、guardrail、凭证轮换与统一 trace。这个边界使 Agent 定义可以引用模型和工具名称而不携带密钥,也说明开放 harness 解决可见性和可改性,跨团队治理仍是独立系统问题。
6. 源码审计后的判断
本期固定的官方仓库提交展示 monorepo 中 server、web、SDK、UI、provider 与部署目录,确实不是只有 README 的发布。更重要的影响是接口可成为公共基准:模型、MCP 和 sandbox 通过可替换 provider 接入,企业可以在不重写 Agent 产品的情况下做成本路由;但仍应为每次 runtime 升级保留回归轨迹。
重要性与影响:开放的是完整运行时而非示例框架,核心价值在可替换模型、按需沙箱、会话持久化和可审计审批。
核心 takeaway:DeepSeek Harness 的关键不是功能数量,而是把运行时的所有能力都降格为可注册、可卸载、可替换的插件,并让同一 append-only session event stream 支撑恢复、分叉、搜索和回放。该设计把 Agent loop 本身也纳入配置与依赖图,提供很强的实验可组合性;代价是插件 API、依赖顺序和事件语义一旦变化,整个系统的可复现性都需要重新验证。
1. Cordis 内核的边界
官方页面把 Cordis 描述为负责 plugin mount、unmount 与依赖的 kernel。模型、工具、skills、sessions、sandboxes、storage、loops、scheduling 和 UI 不直接写死在主程序,而通过 service 与 event 协作。运行时因此更像一个能力容器,预设只是把插件及其配置组合成可启动图。这个边界的实际意义是,插件拿到的是显式服务与事件,而不是通过修改全局单例偷偷扩展能力。
2. 连循环也能替换
大多数 Agent 框架允许增加工具,却把 plan–act–observe 循环固定在内核。DeepSeek Harness 把 loop 也作为插件,意味着相同的模型、存储和工具可以在 standard、code、minimal 或自定义模式中复用。对研究而言,这使控制流成为显式实验变量;对生产而言,也扩大了需要回归测试的状态空间。
3. 事件流作为单一事实源
所有模型可见内容进入 append-only session log,包括 system prompt、reasoning、tool call/result、subagent scheduling 与 context injection。Trajectory 视图按来源检查记录,resume、fork、search 和 replay 使用同一事件流。与只保存聊天文本相比,这能解释一次上下文重写或调度选择如何改变后续动作,也让恢复时可以区分已经执行的副作用、仅生成的计划与后来注入的上下文。
4. 四种运行模式的目的
Standard 暴露完整编码工具;Code mode 让模型生成 TypeScript 程序编排多轮工具;Minimal 只保留 shell 与文件编辑器,适合减少 harness 干扰的模型基准;Creator 则允许在内存中检查和试装插件。它们不是四个产品,而是同一插件图对不同评测目标的约束。
5. 源码中的可逆注册
官方仓库把插件定义、service 注入、event 订阅和 preset 配置分层,架构文档明确要求 dispose 路径撤销注册,避免热加载后遗留能力。会话与存储实现围绕事件追加而非覆盖当前转录,这与页面宣传的 replay 语义一致;审计仍不代表所有第三方插件都满足相同约束。
6. 工程影响
插件化把“换模型”扩展到“换整个控制面”,适合快速比较 loop、工具策略和 memory。相应地,生产系统需要锁定插件版本、依赖解析和 event schema,并对卸载、失败恢复与重放做确定性检查。developer preview 意味着核心 API 仍可能变化,当前更适合作为开放实验运行时而非无条件稳定标准。
重要性与影响:Cordis 把模型、工具、会话、调度乃至 Agent loop 都变成可挂载插件,并用 append-only event stream 提供追踪与回放。
核心 takeaway:Shopify 的 Gisting 把约 6,000 token 的静态系统提示压成约 1,500 个可学习 gist token,模型权重保持冻结,并通过 teacher–student KL 匹配保留输出分布。在 350 RPM 的负载测试中,发布方报告 TTFT 下降 19%、端到端延迟下降约 38%、吞吐提高 16%,最终少用约 14% GPU。它说明 prefix cache 仍无法消除每个解码 token 读取长 KV 的成本,短前缀本身具有独立价值。
1. 问题是静态前缀税
Agent 系统提示往往包含工具规则、业务约束与输出规范,每次请求都携带数千 token。Prefix cache 可以避免重复 prefill,却不能让新生成 token 不再注意这些 KV;解码时读取的缓存仍随前缀长度线性增长,因此高并发和大 batch 下,长静态前缀持续占用显存带宽。
2. 蒸馏对象不是模型权重
方法给词表加入特殊 gist token,只训练其 embedding。Teacher pass 使用完整自然语言提示产生每个响应位置的 logits,student pass 用 gist token 替换提示,最小化两组 logits 的 KL divergence。模型其余参数冻结,所以训练目标是让短前缀触发与长提示接近的条件分布。
3. 部署路径保持普通
训练结束后,gist embedding 直接写入模型 embedding matrix,并把 token 注册到 tokenizer。推理只需把完整系统提示替换成 gist token 字符串,不需要自定义 attention mask、额外 encoder 或专门 serving 引擎。一次性训练成本换取后续每个请求的前缀缩短,也让现有 batcher、prefix cache 与监控链路无需理解新的中间表示。
4. 超参搜索给出的工程结论
Shopify 用 autoresearch loop 提议配方、训练并评测。把系统提示按压缩比例分块,并用块内 token embedding 均值初始化对应 gist,使初始 loss 降低七倍;在其业务上 4:1 是质量开始退化前的最优点。预计算 teacher logits 与预分词又把完整训练从约 30 小时降到 6 小时。
5. 负载证据
系统提示由约 6,000 压到 1,500 token。在 350 RPM,median TTFT 从 438ms 降到 354ms,端到端从 6.8s 降到 4.2s,吞吐由 20.2 升到 23.4 QPS;文章概括为 TTFT 下降 19%、E2E 下降约 38%、吞吐提高 16%,生产配置少用约 14% GPU。这组结果同时覆盖请求延迟、吞吐与容量规划,比单独比较 prefill token/s 更接近线上收益。它也表明节省主要发生在持续解码和并发调度,而不只是在首轮提示预填充。
6. 适用条件与影响
Gisting 最适合长且稳定、质量可用任务级 judge 检查的系统提示。提示频繁变化、需要逐字审计或跨模型复用时,gist 需要重新训练且可解释性较弱。它与 prefix caching 可以叠加,并能在持续学习中把 gist 与模型权重一同更新;版本与回归集因此必须同步管理。
重要性与影响:冻结模型权重,只训练一组 gist embedding 复现长系统提示的行为,在生产负载中同时缩短 TTFT、解码延迟和 GPU 数量。
核心 takeaway:Cursor 不再把一台 Git server 上的仓库目录当作权威状态,而是用对象存储中的线性化 WAL 保存每次引用更新,把本地 NVMe 副本降为可重建缓存。这样可以让读副本随 Agent 负载扩缩,并把故障恢复从机器级复制改成日志重放。
1. 把写入顺序固定在 WAL
Continuity 先将 push 的引用更新序列化写入 S3 上的 WAL,再由本地 Git 副本应用对象与 refs。对象存储承担持久性,本地 NVMe 只负责低延迟读写;副本丢失后从快照和日志恢复,不需要把某台机器视为不可替代的仓库主节点。
2. Agent 负载改变副本经济性
大量并行 coding Agent 会制造短生命周期分支、clone、fetch、PR 与 CI 读取。Cursor 让热点仓库扩展读副本、冷仓库不常驻完整副本,并报告单仓库每秒 120/300 次 push 与上百读副本的测试。真正可迁移的判断是按访问热度配置副本,而不是照搬这些吞吐数字。
重要性与影响:Continuity 用 S3 上的线性化 WAL 作为真相源,把本地 NVMe Git 副本视为可丢弃缓存;读副本可按负载扩到上百个,空闲小仓库甚至无需常驻副本。该架构直接回应 Agent 造成的大量临时仓库、PR 与 CI 流量,但 120/300 pushes/s 和百副本线性扩展均是 Cursor 的系统测量。
核心 takeaway:IsoExec 把训练–推理一致性定义为一套可执行的数值契约:相同算子、累积精度与固定归约顺序必须跨 vLLM rollout 和 Megatron trainer 保持一致。它把 log-prob 偏差压到接近零,但也明确展示了约四分之一训练步开销。
1. 统一的不是 API,而是数值路径
仅让训练器和推理引擎使用相同权重与 tokenizer,仍会因为 kernel、累积精度和并行归约顺序不同而产生概率偏差。IsoExec 让两侧遵循同一 execution contract,并以固定二叉归约树保持并行拓扑变化时的运算次序。
2. 一致性收益需要单独计价
在 Qwen3.5-35B-A3B、8×H100 与 50 个 RL step 的实验中,平均 log-prob 差异从 4.035×10⁻² 降至 6.821×10⁻⁷,step 时间约增加 25%;短实验未观察到明显 reward 增益。因此它首先是正确性与可诊断性基础设施,还不是已证明提高最终奖励的算法。
重要性与影响:IsoExec 用跨框架执行契约与并行拓扑不变 kernel 对齐 vLLM rollout 和 Megatron trainer;发布方报告平均 log-prob 差异由 4.035×10⁻² 降至 6.821×10⁻⁷,RL step 约增加 25%,而 50 步短实验未见明显 reward 增益。