llm-agent/2026-08-29-Agents-LLM-Harness-论文日报-2026-08-29.md

Agents / LLM / Harness 论文日报(2026-08-29)

今日概览

本期检索窗口为 2026-08-28 09:40 至 2026-08-29 09:40(新加坡时间)。arXiv 周六通常不发布新列表,因此本期主要核对 2026-08-28(周五)新列表中首次公开出现的论文,并补查 OpenReview、ACL Anthology 与论文正文;论文的原始提交时间可能早于列表出现日 1–2 天。今天最值得关注的信号是:Agent 能力越来越明确地由“模型 × Harness”共同决定,研究焦点正从单次提示优化转向上下文视图、在线监督、技能知识库、非幂等委派和可验证安全评测。共筛出 8 篇,均为 v1 首次公开出现;未用无实质更新的旧稿或纯观点文章补数。

重点论文

1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

2. Same Model, Different Harness: Different Coding-Agent Results

3. WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

4. When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems

5. NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

6. PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?

7. Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling

8. Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation

值得继续追踪

  1. Harness 评测从配置描述升级为 solver 规格:继续观察 Same Model, Different Harness 的结论能否在 hosted frontier model、非代码任务和重复采样下成立,并要求 leaderboard 固定工具、上下文视图、停止规则与安全策略。
  2. 在线自改进的收益与风险:PILOT 与 WikiSkill 分别覆盖单次运行内纠偏和跨运行知识积累;后续关键是验证错误经验污染、skill 冲突、回滚和验证集过拟合,而不只是平均通过率。
  3. Agent 记忆的混合表示:CoVeMem 证明向量协同记忆可替代高成本文本重写;应追踪其在兴趣漂移、冷启动、隐私删除和流式更新下能否保持收益。

实践启发

  1. 做一次“完整轨迹 vs. 工作视图”在线推理回放实验:固定模型、候选集与工具,把最近 N 次工具结果完整保留,其余按年龄与长度机械裁剪;对生成式召回链路比较 Recall@K、非法工具调用率、P95 token、P95 延迟和任务完成率。优先在长工具输出、反复重试的请求分桶评估,避免平均值掩盖收益。
  2. 给推荐 Agent 增加协同向量记忆旁路:用现有 user/item 图表征构建只读 memory bank,按当前候选检索历史状态并映射为少量 soft tokens,与文本画像并行输入;先离线比较文本记忆、纯协同塔、混合记忆的 NDCG/Recall、长尾覆盖和推理成本,再做小流量线上实验。
  3. 把运行时可靠性指标从“错误率”扩展到“进展与副作用”:为每次 Agent 委派记录稳定 delegation ID、工具副作用 ledger、可单调变化的 progress signal 和失败归属;用回放注入重复成功调用、超时重试、过期状态与错误路由,检查是否能在不增加误杀的前提下提前终止无效消耗。

检索说明


归档状态:待保存
企业微信速览发送状态:待发送