Agents / LLM / Harness 论文日报(2026-08-28)
今日概览
本期检索窗口为 2026-08-27 09:11 至 2026-08-28 09:11(新加坡时间),重点核对 arXiv 于 2026-08-27 公布的 cs.AI、cs.CL、cs.LG 新列表与修订列表,并补查论文摘要、HTML 正文入口和项目页。今日最明显的趋势是:Harness 正从固定工程脚手架升级为可训练、可生成的能力层;与此同时,研究开始更严格地区分“模型声称完成”“模拟器判定成功”和“现实环境确实完成”。
共精选 9 篇:8 篇为本批次首次公开出现的研究,1 篇为明确列出新增架构、实验与形式化证明的重大修订。arXiv 的原始提交时间可能早于新列表公告日;本报告同时标注提交/修订时间和首次进入本期新列表的口径。以下作者信息来自 arXiv 元数据;摘要页未列机构时不做猜测。
重点论文
1. JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
- 作者 / 机构:Guibin Zhang、Leo Lu、Fangzhou Xie、Kang Zhu、Junhao Wang、Zhifei Xie、Zhaochen Yu、Zihang Liu、Zhongxiang Sun、Qiankun Li、Yue Liao、Heng Chang、Xiaobin Hu、Qibing Ren、Wangchunshu Zhou、Shuicheng Yan;机构见论文正文
- 日期:2026-08-26 提交;2026-08-27 进入 arXiv 新列表
- 标签:Harness 生成、Harness 自进化、规划、记忆、工具编排
- 原文:arXiv:2608.25593
- 核心问题:Agent 的能力不仅由底层模型决定,记忆、规划、行动协议和工具编排组成的 Harness 往往同样关键,但当前 Harness 多依赖人工、针对单一任务设计。
- 方法与关键结果:论文把 Harness 表示为遵循四模块协议的可组合生成物,训练 JIT-Agent 针对任务即时生成、修复并从历史配置与性能信号中自我演化 Harness。作者报告,JIT-Agent 辅助下 DeepSeek-V4-Flash 在 DeepSearchQA 和 OdysseyBench 上分别超过 GPT-5.6 9.1 和 4.3 分;GLM-5.2 最高提升 20.2 分,并在多组模型上与 OpenCode、Claude Code 等成熟运行时具有竞争力。
- 创新点:把 Harness 从人工代码与提示模板提升为独立、可训练、可迁移、可积累经验的模型能力层。
- 局限性:核心结果来自作者设定的协议、模型和基准,摘要页尚未给出公开代码信息;Harness 搜索本身的训练成本、配置稳定性、安全边界以及真实线上分布下的收益仍需独立复现。
- 为什么值得关注:这是今天与 Harness 主题最直接的论文。它支持一个越来越重要的判断:同一底模的能力上限,可能首先受制于运行时与上下文编排,而不是参数规模。
2. Prefix Sliding for Efficient Test-Time Scaling
- 作者 / 机构:Niklas Muennighoff、Zhengyang Wang、Zeyi Chen、Weijia Shi、Binyuan Hui、John Yang、Dapeng Jiang、Mika Senghaas、Fares Obeid、Johannes Hagemann、Sami Jaghouar、Ludwig Schmidt、Percy Liang、Jason Wei、Andrew Y. Ng、Luke Zettlemoyer、Yejin Choi、Mike Lewis;机构见论文正文
- 日期:2026-08-26 提交;2026-08-27 进入 arXiv 新列表
- 标签:长推理、Test-time Scaling、KV Cache、上下文工程、推理效率
- 原文:arXiv:2608.26070
- 核心问题:长时间推理会不断扩张注意力上下文和 KV Cache,使测试时扩展的显存与计算成本随轨迹长度增长。
- 方法与关键结果:Prefix Sliding 永久保留包含核心指令和工具定义的前缀,同时只保留最近数千 token 的滑动窗口,丢弃已经失去作用的中间推理 token。作者报告,无需训练即可让现有模型最高提速 3 倍且维持性能;配合强化学习训练后,可把推理轨迹扩展到 10 万 token 以上,并优于中间摘要和普通滑窗。
- 创新点:把长推理上下文拆成“不可丢的根前缀”和“可滑动的工作记忆”,使显存上界不再随思维轨迹无限增长。
- 局限性:方法假定远距离中间推理多数可丢弃;依赖早期推导、长期变量绑定或跨段引用的任务可能退化。3 倍加速是作者报告的最高值,仍需在不同模型、并发负载和服务框架上复测。
- 为什么值得关注:这是一种非常接近 Harness/推理服务交界面的优化,既能用于长链推理,也能用于工具调用轨迹和多轮 Agent 的上下文裁剪。
3. FrontierChallenge: Evaluating Scientific Workflow Completion
- 作者 / 机构:Liangcai Su、Zhaopeng Feng、Zhuo Chen、Zhen Zhang、Xiang Lin、Ruilin Li、Handuo Zhang、Ning Wang、Kailong Wen、Yueqi Guo、Feng Xing、Yiling Guo、Chenxiong Qian、Simon Shaolei Du、Lidong Bing、Xinyu Wang;机构见论文正文
- 日期:2026-08-25 提交;2026-08-27 进入 arXiv 新列表
- 标签:Agent Evaluation、科学工作流、代码执行、完成度验证
- 原文:arXiv:2608.24979
- 核心问题:现有 Agent 基准多评价最终答案或孤立代码,无法判断 Agent 是否真正交齐一项端到端科研任务要求的全部工件。
- 方法与关键结果:FrontierChallenge 构建 300 个跨领域科学工作流,本次发布并评测其中 97 个,覆盖量子化学、分子动力学、材料表征、生命科学等领域;测试 12 个前沿模型和 3 种 Agent 脚手架。最佳配置仅完成 97 项中的 20 项,Pass Rate 为 20.6%。在分析化学和电化学/环境领域,平均部分得分可达 87.6 和 94.9,但最高完整通过率只有 4% 和 0%;未通过的 Claude Code 轨迹中 75.5% 仍在结尾声称已完成。
- 创新点:把评测对象从答案正确率升级为“可交付工件是否完整”,并显式测量部分进展与真正完成之间的断层。
- 局限性:目前只公开 97/300 个任务;领域集中于科学计算,结论不能直接外推到所有商业 Agent。完整通过判定依赖任务定义和验证器质量。
- 为什么值得关注:它给生产 Agent 一个很现实的警告:自报成功、步骤分数高和实际完成是三件不同的事,Harness 必须用外部状态与工件验证闭环。
4. APPA: Recoverable Information-Flow Control for Real-World LLM Agents(v2 重大修订)
- 作者 / 机构:Arseny Kravchenko、Vadim Liventsev、Innokentii Konstantinov、Ildar Iskhakov、Matvey Kukuy;机构见论文正文
- 日期:v1 于 2026-07-27 提交;v2 于 2026-08-26 修订,并进入 2026-08-27 修订列表
- 标签:Agent 安全、MCP Gateway、信息流控制、Prompt Injection、恢复机制
- 原文:arXiv:2607.24625v2
- 本次修订内容:作者明确说明 v2 更新了标题,新增 MCP 协议网关架构、3 模型/6,600 episode 实证基准、恢复消融、渐进式安全类型和完整形式化安全证明,属于实质性修订。
- 核心问题:传统污点追踪一旦读取不可信内容,往往只能永久阻断后续操作,导致安全性与可用性难以兼得。
- 方法与关键结果:APPA 在工具派发与 MCP 网关设置双阶段引用监视器,并用一次性子轨迹隔离不可信上下文,只允许经过结构约束的结果回流主 Agent。在 6,600 个受控 episode 中,作者报告系统保持 64.2%–91% 的任务效用,并在 1,320 个受保护 episode 中观察到 0 次成功攻击。
- 创新点:把 Agent 信息流控制从“检测后中止”改成“策略约束下恢复”,同时给出渐进部署和形式化证明。
- 局限性:零观察攻击不等于现实零风险;受控攻击集、标签设计和网关覆盖面决定结论边界。大规模工具生态中的标注成本、旁路协议和性能开销仍需线上验证。
- 为什么值得关注:对接入 Web、MCP、内部数据和有副作用工具的 Agent,恢复式隔离比单纯拒绝更接近可用的生产安全方案。
5. SimVerity: When Does Simulated Agent Success Survive Physical Deployment?
- 作者 / 机构:Zhonghao Zhan、Yefan Zhang、Krinos Li、Hamed Haddadi;机构见论文正文
- 日期:2026-08-25 提交;2026-08-27 进入 arXiv 新列表;AAAI-27 主会投稿审稿中
- 标签:现实部署、Agent Evaluation、智能家居、验证迁移
- 原文:arXiv:2608.25067
- 核心问题:Agent 在模拟器里通过测试,究竟能为真实物理部署提供多强的成功证据?
- 方法与关键结果:SimVerity 在目标智能家居上重放匹配场景,并用独立物理观察设备交叉验证。模拟器判定 240 次灯光试验全部通过,但摄像头捕获到 42 次短于一秒、最终状态检查看不到的失败;基于真实测量锁定的风险模型,在两个 cohort 的 11 个留出 session 中均优于不感知属性的基线。更换模型客户端/服务配置还把一个 Agent 环路的场景匹配率从 52%–88% 提升到 100%。
- 创新点:把模拟到现实的验证迁移建模为 clear / abstain / escalate 决策,而不是简单相信模拟器的 pass/fail。
- 局限性:实验集中在智能家居灯光和有限 cohort,物理观察设备本身也可能有盲点;框架在机器人、浏览器和金融执行等场景中的泛化尚未证明。
- 为什么值得关注:它提醒 Agent 评测必须捕获过程中的瞬态失败,不能只验证最终状态;这同样适用于在线推荐链路中的短时超时、候选骤减和回退抖动。
6. Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs
- 作者 / 机构:Jian Wang、Steven Xu、Sanjyot Thete、Maryam Barouti、Tom Tang、Elaine Wu、Charu Sareen、Kyle MacDonald;机构见论文正文
- 日期:2026-08-25 提交;2026-08-27 进入 arXiv 新列表
- 标签:级联推理、Agentic VLM、检索、实体匹配、成本控制
- 原文:arXiv:2608.25037
- 核心问题:亿级商家记录与千万级标准商品匹配中,统一使用强模型成本过高,统一使用轻模型又无法解决困难长尾。
- 方法与关键结果:系统先召回候选,再用轻量文本 Cross-Encoder 自动处理高置信样本,最后只把模糊尾部升级给可看图并执行 Web 搜索的 Agentic VLM。Cross-Encoder 从数百万个双 VLM 共识标签蒸馏,并按 98% precision 阈值自动接受;自托管开放 VLM 以约闭源前沿 VLM 1/7 的单对成本达到相同精度,但召回率为 88% 对 92%。困难样本升级使端到端覆盖率从 68% 提升至 77%。
- 创新点:不是用 Agent 替代全部模型,而是把 Agent 作为昂贵但高能力的升级层,让计算量随样本难度分配。
- 局限性:训练标签主要来自模型共识,人工核验集较小;生产数据、类别分布和完整成本核算难以外部复现。Web 搜索还会引入延迟、时效性与安全风险。
- 为什么值得关注:这是对推荐/搜索最直接的工程启发之一:低成本主路径覆盖大多数请求,只对低置信、高价值长尾启用更强推理。
7. LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data
- 作者 / 机构:Zhen Dong、Yuning Peng、Yutao Shi、Lei Zhong、Yongsen Mao、Yuan Liu、Haiping Wang;机构见论文正文
- 日期:2026-08-25 提交;2026-08-27 进入 arXiv 新列表
- 标签:MCP、规划、工具调用、多模态检索、Agent Benchmark
- 原文:arXiv:2608.25039
- 核心问题:现实地理规划不仅依赖干净地图数据,还要从大规模、嘈杂的本地社交媒体内容中寻找证据并满足多重约束,而现有基准往往回避了这一难点。
- 方法与关键结果:LifePlanner 将地图数据与大规模本地社交媒体帖子结合,通过 MCP 工具集提供四类、三个难度级别的规划任务。前沿模型在简单检索上表现较好,但复杂规划 Pass Rate 降至 40.2%;主要失败来自证据获取不完整、工具使用不精确和约束整合薄弱,而非单纯模型规模或推理长度不足。
- 创新点:把开放世界噪声、多模态证据与 MCP 工具调用纳入同一个可评测规划环境。
- 局限性:摘要未披露数据地域覆盖、许可与时间漂移处理;社交媒体分布可能带来地域和语言偏差,MCP 工具实现也可能影响模型间公平性。
- 为什么值得关注:它说明“让模型想更久”不一定解决规划失败,检索覆盖、工具参数和约束状态管理可能才是 Harness 的瓶颈。
8. post-graph-rag: A PostgreSQL-Native Graph RAG Engine
- 作者 / 机构:Chandan Rajah;机构见论文正文
- 日期:原始提交记录为 2026-08-14;2026-08-27 首次进入本期 arXiv 新列表,无额外版本记录
- 标签:Graph RAG、PostgreSQL、时态知识、检索基础设施
- 原文:arXiv:2608.24921
- 核心问题:Graph RAG 常需同时维护向量库、图数据库和文档库;无拒绝机制的抽取会持续写入无意义关系,纯累加图又难以区分当前事实和已失效事实。
- 方法与关键结果:系统把文本、向量、实体图和社区摘要统一存入 PostgreSQL/pgvector,在写入前拒绝模糊谓词、代词实体和裸数量,并支持关系有效期、冲突事实替换与 as-of 查询。与 LightRAG 在三个语料上的同模型对比中,关系/实体密度最高提升 2.4 倍,查询延迟更低,并能识别基线无法处理的时序替换。
- 创新点:把 Graph RAG 的工程一致性、抽取质量门禁和时态更新统一到一个数据库内,减少多存储同步成本。
- 局限性:作者明确称这些是工程测量而非正式 benchmark;语料规模和查询集合有限,关系更密不必然意味着答案更准确。该论文提交日与新列表出现日相隔较长,纳入依据是本期首次公开出现。
- 为什么值得关注:对长期运行 Agent 和推荐知识系统,事实“可过期、可替换”往往比单纯增加记忆更重要;它提供了一个较具体的运行时数据层设计。
9. Understanding the Energy Scaling of Large Language Model Inference Across Context Lengths and Attention Architectures
- 作者 / 机构:Molka Chkir、Syed Muhammad Danish、Jos Höll、Arghavan Asad;机构见论文正文
- 日期:2026-08-25 提交;2026-08-27 进入 arXiv 新列表
- 标签:LLM Serving、能耗、长上下文、注意力架构、批处理
- 原文:arXiv:2608.25096
- 核心问题:不同注意力结构、上下文长度和批量配置如何共同决定 LLM 解码阶段的能耗与延迟?
- 方法与关键结果:作者用 NVIDIA 硬件计数器测量四个开源模型,比较 MHA、GQA 和 GQA+SWA 在不同上下文、batch 和生成负载下的 decode 能耗。MHA 随上下文增长的能耗斜率明显高于 GQA,而 GQA+SWA 接近恒定;模型规模主要决定绝对能耗,批处理最多可同时降低每 token 能耗和请求延迟 87%。
- 创新点:用实测把注意力架构、KV Cache 增长和能耗扩展关系连接起来,为长上下文服务选型提供依据。
- 局限性:仅覆盖四个模型、NVIDIA 计数器和 decode 阶段,没有完整计入 prefill、CPU、网络与机房能耗;“最多 87%”不能直接外推到低并发或严格尾延迟场景。
- 为什么值得关注:在线 Agent 的上下文越来越长,服务成本不能只看 token 数;架构类型、batch 和 KV Cache 策略会决定实际能耗与 P95 延迟。
值得继续追踪
- JIT-Agent 的可复现性与安全边界:关注代码、训练数据和 Harness 配置档案是否公开;重点验证自动生成 Harness 在分布外任务上是否稳定,以及是否会生成危险工具权限或隐性提示注入通道。
- Prefix Sliding 的任务依赖性:继续观察它在多轮工具调用、代码编辑、需要引用早期证据的 Deep Research 和真实并发服务中,能否同时守住准确率、P95/P99 延迟与 KV Cache 上限。
- 完成度评测外溢到生产:追踪 FrontierChallenge、SimVerity 的验证思想能否迁移到浏览器、推荐、数据分析等 Agent;关键是建立与环境状态绑定、不可由模型自报替代的完成条件。
实践启发
- 在生成式召回上做“固定模型、可搜索 Harness”实验:冻结现有两层 SID Transformer,只搜索上下文裁剪、历史队列摘要、候选约束、解码预算和失败回退五类 Harness 参数。对照当前固定流程,比较 Recall@K、unique coverage、非法 code 率、P95 延迟和每请求成本;若收益显著,说明下一阶段应优先优化运行时而非继续加宽底模。
- 为 T4 在线推理实现 Prefix + Recent Window 的离线回放:固定保留用户属性、任务指令和码本定义,只滑动保留最近的行为/推理窗口。按 64/128/256 条历史做分桶,比较显存、吞吐、P95、Recall@K 和长尾主播覆盖,确认“删除中间历史”是否比统一截断更稳。
- 用置信度升级替代全量重模型:借鉴 Retrieve–Match–Escalate,让低成本生成路径处理高 margin 请求;仅对 token 熵高、top1/top2 margin 小、非法码风险高或候选不足的请求启用额外 beam、重排或强模型。离线 replay 中同时画出覆盖率—准确率—成本曲线,再决定线上升级比例。
检索说明
- 主要数据源:arXiv cs.AI 新列表、arXiv cs.CL 新列表、arXiv cs.LG 新列表,以及各论文 arXiv 摘要页、HTML/PDF 入口和已公开项目/代码链接。
- 关键词:agent、agent harness、scaffolding、runtime、planning、memory、tool use、MCP、workflow、evaluation、computer use、RAG、long context、test-time scaling、LLM serving、inference、safety、alignment、post-training。
- 时间口径:以 2026-08-27 arXiv 新列表/修订列表在检索窗口内首次公开出现为主,并保留原始提交时间。arXiv 公告日与作者提交时间不完全相同。
- 去重与筛选:按 arXiv ID、标题和作者合并 cs.AI/cs.CL/cs.LG 交叉列表;旧论文只有在 changelog 明确显示新增架构、实验、数据或证明时才纳入。纯综述、纯观点稿、无实验的概念框架、标题相关但技术贡献弱的应用论文均排除。
- 特别排除:SIMGUIDE 虽出现在本期列表,但 arXiv 页面显示 v1 原始提交为 2026-05-14,且无本期修订记录,因此未纳入;Scorpio、IAPO 等旧论文的本期列表记录没有提供足够明确的版本增量说明,也未作为修订论文推荐。