llm-agent/2026-08-27-Agents-LLM-Harness-论文日报-2026-08-27.md

Agents / LLM / Harness 论文日报(2026-08-27)

今日概览

本期检索窗口为 2026-08-26 08:45 至 2026-08-27 08:45(新加坡时间),重点核对 arXiv 在 2026-08-26 发布的新论文列表,并补查 OpenReview、ACL Anthology 与作者/机构页面。今日最清晰的趋势不是单纯扩大模型,而是把 Agent 的执行轨迹、协作协议、推理调度和引用链路变成可观测、可优化的系统对象。共筛出 7 篇值得关注的工作;没有纳入纯观点稿、无实验论文,以及虽出现在列表中但原始元数据明显不属于本窗口的旧稿。

时间口径说明:arXiv 的“新列表出现日”与作者原始提交时间可能相差 1–2 天。本报告以 2026-08-26 新列表首次公开出现为纳入依据,同时保留每篇论文的原始提交日期。

重点论文

1. Automata from Agent Traces: Failure and Next-Step Prediction

2. Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research

3. AgentSpec: Speculative Decoding for Batch Inference of LLM Agents

4. AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

5. Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

6. Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings

7. Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

值得继续追踪

  1. Harness-native inference:继续观察 AgentSpec 是否能在真实在线流量、工具等待、混合上下文长度和 P95/P99 延迟约束下保持收益;尤其要验证语义块标注成本是否抵消解码收益。
  2. 结构化运行时监控:重点追踪 Automata from Agent Traces 在动作空间更大、策略频繁更新和线上分布漂移时,FSM 是否仍保持紧凑,以及误杀早停的实际成本。
  3. 跨 Agent 错误归因:关注 Deep Research 的局部忠实性评测能否扩展到表格、数值计算和代码执行结果,并减少对 LLM judge 的依赖。

实践启发

  1. 给生成式召回建立“轨迹 FSM 监控”小实验:将每次在线推理抽象为有限动作序列,例如输入校验→用户编码→c1 展开→c2 展开→在线集合过滤→热度融合→返回。用近 7 天成功/异常轨迹训练 FSM,测试它能否提前识别非法 code 比例升高、beam 退化、候选骤减等异常;指标用 AUROC、误报率、提前量和节省的无效 GPU/CPU 时间。
  2. 按结构块做缓存与预算分配:借鉴 AgentSpec,不要把历史生成统一视为一个缓存池。可分别维护 c1、c2、c3 或“用户编码/码本解码/在线重排”的重复模式,并把额外计算预算分给历史一致性更高、接受概率更高的请求。先做离线 replay,比较固定预算与冗余度自适应预算的 Recall@K、P95 延迟和吞吐。
  3. 尝试相似度分布蒸馏召回塔:用当前较大 user/item encoder 产生 batch 内候选相似度分布,训练更小的线上 encoder 对齐分布,而不是逐维拟合 embedding;重点对比维度变化时的 Recall@K、长尾主播覆盖、SID 前缀分布和线上 QPS。该实验与 Giga-Embeddings 的蒸馏思路直接相关,但必须使用业务负样本与在线候选分布重新验证。

检索说明