每日 AI 论文早报|2026-08-26
覆盖 arXiv 2026 年 8 月 26 日公告批次;页面提交日期主要为 8 月 24–25 日,以“进入 8 月 26 日新稿列表”为收录口径。精选 14 篇:搜索、广告与推荐 6 篇,Agent/RAG/记忆 5 篇,LLM 训练与推理系统 3 篇。当天最强信号是:性能瓶颈正从单纯扩大模型,转向 SID 与索引结构、监督信号质量、工具暴露方式和批量推理调度。
今日速览
- 今日主线:生成式推荐集中出现了动态直播 SID、flow-based 独立 Item Tokenizer、层级 DocID 与同前缀困难负例;这几项都直指“码本可用,但生成器没有充分消费层级结构”的问题。
- 最重要工程启示:不要默认端到端训练或自然负样本就足够。淘宝的 Mine-Then-Train 与 RetrievalFormer 的全量 softmax 对照都表明,监督噪声和采样近似可能比模型深浅更先限制收益。
- 整体证据风险:工业论文很多,线上增益主要来自作者自报且数据不可公开;除 Tlow、Recuris、StarHarness 外,多数条目未确认关键代码,跨平台复现仍需谨慎。
搜索、广告与推荐系统
本组的共同变化是把“地址怎么构造、哪些样本可信、负例如何组织、每次检索算多少维”变成显式设计变量,而不再只调大 Encoder 或码本。
1. TAGR:面向工业直播广告的时间自适应生成式推荐
TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising
作者/机构: Wencai Ye、Guangyi Liu、Chaoyi Wang 等;快手科技、清华大学 | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、工业预印本、审稿中
核心方法与结论: TAGR 同时在三层做时间适配:LSID 根据实时直播场景与在售商品周期性重分配 SID,但保持层级词表稳定;IAG 将直播间进入行为按多时间尺度编码,并把点赞、加购、订单等行为分通道输入;IOPO 在在线 NTP 维护之间间歇执行基于当前策略候选的 GRPO。作者报告进房率 +8.5%、加购点击率 +7.4%、收入 +16.1%,并称单张 L20 可支撑 2,500+ QPS、召回延迟低于 100 ms。
相较既有工作: 它不是只给静态主播或商品分配一次 SID,而是让直播广告地址随“场景 × 商品集合”变化;训练侧又用后验行为深度、用户价值和商业价值共同加权各层 token 的 NTP 损失。
为什么值得关注: 这与直播主播生成式召回最接近,尤其适合检验当前低 unique coverage 究竟来自静态 SID、单尺度历史,还是正样本可信度不足。它也给出了动态 SID 与稳定在线词表共存的工程方案。
证据与复现: ⚠️ 工业自报、内部数据、无公开代码;线上基线、流量切分和置信区间无法独立核验,论文仍在审稿。
2. Tlow:基于流模型的 Item Tokenizer
Tlow: Flow-based Item Tokenizer for Recommendation
作者/机构: Nian Li、Chonggang Song、Jingtao Ding 等;清华大学、腾讯 | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、CIKM 2026 Applied Research 已接收
核心方法与结论: Tlow 先用可逆 flow 将原始语义 embedding 变换到近似标准正态、维度相关性更弱的潜空间,再对不同子空间独立量化,避免 RQ-VAE 码本之间的自回归依赖。它还用 codebook guidance 对齐 token embedding 与量化码字的两两余弦结构。四个公开数据集上离线指标提升;微信多模态检索线上报告整体 CTR +10.32%,新物品 CTR +11.64%。
相较既有工作: 相比 RQ-VAE 的逐层 residual code,它先简化 embedding 分布再独立生成多个 token;相比 OPQ,又显式处理非高斯分布与维间相关性,并让推荐模型中的 token 空间继承 codebook 几何。
为什么值得关注: 这为两层 SID 提供了一条“保留离散码、去掉层间解码依赖”的替代路线。若当前 c1/c2 联合路径有效但自回归解码和碰撞拖累覆盖率,Tlow 比单纯扩大第二层码本更值得测试。
证据与复现: ✅ 关键代码已公开,且论文已接收;⚠️ 微信线上数据与生产配置不可公开,工业增益仍是作者自报。
3. CodeHID:可寻址层级代码索引的生成式检索
CodeHID: Learning an Addressable Hierarchical Code Index for Generative Code Retrieval
作者/机构: Zhen Li、Yuhong Chen、Wenhao Xu、Xiaodong Li、Hui Li;厦门大学 | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: CodeHID 用多层 residual quantization 构造静态层级 DocID,并加入 kNN 伪邻居监督,使语义相近代码共享浅层前缀、深层仍保持目标可分性。生成阶段同时加入同前缀困难负例、教师相关性排序蒸馏、合法候选约束和 prefix-aware decoding;在 CoSQA、ProCQA 上多数设置超过稀疏、稠密与生成式检索基线,优势主要集中在 rank-1。
相较既有工作: 新增点不只是“给文档分层编码”,而是把索引学习、同前缀竞争监督和推理约束作为一体化路径;困难负例之间的相对排序也被保留,而非压成二元负标签。
为什么值得关注: 对两层主播 SID 最直接的启示是:相同 c1、不同 c2 的候选不是普通负例,而是应带有细粒度相对强弱的局部竞争集合。这可能比无结构地加入自然 1:10 负样本更能提高前缀内区分率和 unique coverage。
证据与复现: ⚠️ 预印本、未确认公开代码;只有代码检索公开基准,没有大规模推荐或线上延迟验证。
4. AdaWidth:按查询自适应稠密检索维度
AdaWidth: Query-Adaptive Embedding Width for Dense Retrieval
作者/机构: Shubing Yang、Dongfang Zhao;机构未在 arXiv 摘要页确认 | 日期: 2026-08-24(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: AdaWidth 用同一个正交 prefix adapter 同时旋转 query 和 document embedding,把判别信号集中到前部维度,同时保持完整维度内积不变。轻量路由器读取初步排名的顺序统计量,仅为可能改变 Top-K 的查询继续计算更多维度。六个检索任务、五个冻结编码器上,在保持 NDCG@10 的同时平均少计算 55%–84% 的维度。
相较既有工作: 固定 Matryoshka 截断让所有查询用相同宽度,动态 mask 又仍需访问完整向量;AdaWidth 则让每个查询沿共享前缀按需扩宽,并给出所需维数与语料规模、检索深度的关系分析。
为什么值得关注: 若主播召回未来引入多向量或更宽 embedding,这提供了按请求难度动态分配算力的思路;简单用户可用短前缀,候选边界模糊的用户再扩宽,有机会控制 T4 p99 延迟。
证据与复现: ⚠️ 预印本、未确认公开代码;当前证据是离线检索效果与维度节省,不等同于 GPU 端到端延迟收益。
5. 从 CTR 日志中先挖出“多模态可解释”样本再训练
Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios
作者/机构: Chao Yi、Feifan Yang、Jiawei Feng 等;阿里巴巴淘天集团、中国科学技术大学 | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、CIKM 2026 已接收、工业论文
核心方法与结论: 作者发现直接用 CTR loss 端到端微调多模态 Encoder 不增反降:点击同时包含价格比较、位置偏置、误触与兴趣疲劳,导致共享 Encoder 的跨样本、跨 batch 梯度高度不一致。Mine-Then-Train 先训练标注模型,从 CTR 日志筛出“符合点击偏好、能由内容语义解释、且补充现有 ID/内容特征”的样本,再单独微调 Encoder。淘宝展示广告长期 A/B 报告 CTR +1.5%、RPM +0.5%。
相较既有工作: 它不依赖 ID 分支自行吸收非语义噪声,也不继续给联合损失加正则,而是在表示学习之前做监督归因和样本筛选。
为什么值得关注: 这与正负样本混训高度相关:自然负样本并不等于有效负监督。对主播内容 embedding,可先筛选真正由封面、标题、语言或区域可解释的正负对,再更新共享塔,避免大量与内容无关的行为梯度污染所有主播表示。
证据与复现: ⚠️ 已接收但无公开代码;数据、标注模型与线上 A/B 均为内部资产,结果无法独立复现。
6. RetrievalFormer:冷启动开放索引与采样训练的真实代价
RetrievalFormer: A Dual-Encoder Transformer for Efficient Approximate Nearest Neighbor Retrieval and Cold-Item Recommendation
作者/机构: Theodore Rogers、Joe Standerfer、Dmitrii Timoshenko 等;机构未在 arXiv 摘要页确认 | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: 双塔内容索引可直接接纳零交互新物品;严格无泄漏冷启动下 Recall@20 为 0.172±0.006,是最强重训专用方法的 1.4 倍。但在 warm 推荐上仍落后最强序列基线。关键诊断是:全量 softmax 相比 sampled InfoNCE,在 MIND-small 和 MovieLens-1M 上分别把 Recall@20 提高 54% 和 6.9%,但到 24 万物品时显存耗尽;ANN 并不能解释剩余差距。
相较既有工作: 论文没有只报告冷启动优势,而是用全目录评估、重训基线和训练目标对照,明确把“服务近似”和“负采样训练偏差”拆开。
为什么值得关注: 对当前自然约 1:10 的正负混训,这是很强的警告:若负例过易或覆盖不足,模型提升上限可能由采样目标决定,而非 Encoder 层数。优先做 in-batch、同 c1 困难负例和 sampled-softmax 校准对照更有诊断价值。
证据与复现: ⚠️ 预印本、未确认公开代码;优点是报告了负结果、置信区间和数据处理 bug,但 24 万规模仍远小于很多工业目录。
AI Agent、RAG 与长期记忆
本组从“把所有工具和历史塞进上下文”转向显式的检索式工具暴露、结构化工作记忆、可验证证据图和可回滚 Harness 演化。
7. SCOUT:企业 MCP 网关中的混合语义工具发现
Hybrid Semantic Tool Discovery for Enterprise MCP Gateway: Architecture and Implementation
作者/机构: Olympia Saha、Amy Wang、Srinivasan Manoharan;PayPal | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、工业技术报告
核心方法与结论: SCOUT 在聚合 200+ MCP Server、2,000+ 工具的网关前只暴露 tool_search 与 execute_tool 两个元工具;tool_search 用 BM25 与稠密向量经 RRF 融合,按当前步骤返回 Top-K schema。PayPal 生产环境报告工具 schema token 从 140.2k 降至 1.3k,占上下文比例从 70.1% 降至 0.8%,减少约 99%。
相较既有工作: Prompt cache 只减少重复 prefill,不减少模型可见工具,也不改善路由;SCOUT 将工具选择前置为检索问题,并把目录更新、鉴权和观测保留在统一网关。
为什么值得关注: 对插件与技能较多的 Agent,工具表示本身就是召回特征。生产上应优先保证高召回的小候选 schema,而不是依赖模型在上百个完整工具定义中自行选择。
证据与复现: ⚠️ 工业自报、无公开代码与工具路由准确率明细;成本下降可信度高于任务成功率提升,因为论文摘要只明确报告了 token 规模。
8. Recuris:长期任务中的经验记忆—工作记忆递归演化
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
作者/机构: Zhaochen Yu、Yingcheng Wu、Zhenfei Yin 等;NUS、Princeton、Stanford、Oxford | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: Recuris 用 Working Memory 维护经证据验证的当前任务状态,再据此从 Experiential Memory 选择 Skill;结构化轨迹把失败定位到特定记忆组件,Meta-Agent 只生成局部 patch,并由确定性验证门决定是否接纳。四个长期基准、十种模型的 37 个可完成组合中改善 35 个;最长任务增益达到 32.2 个点,常见长期失败最多减少 80%。
相较既有工作: 它不修改下游模型权重,也不把整个历史压成一个总摘要;技能演化是组件级、验证门控和有界递归的,且可跨模型复用。
为什么值得关注: 对长流程研究与工程 Agent,状态、经验和技能应分层存储。尤其可借鉴“只有通过配对验证的记忆修改才进入长期 Skill Memory”,防止错误经验在后续任务中持续放大。
证据与复现: ✅ 已公开代码、Skill Memory 包和冻结评测切分;⚠️ 部分基准仍依赖 LLM 用户模拟器与 judge,跨供应商结论需复核。
9. EviGraph:为信息检索 Agent 构造可验证证据图
EviGraph: Towards Verifiable Evidence Construction for Information-Seeking Agents
作者/机构: Jiashun Chen、Yirong Mao、Wenhui Que;机构未在 arXiv 摘要页确认 | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: EviGraph 将搜索执行与证据记录拆开:Executor 规划短查询,冻结 verifier 从网页抽取带支持/反驳极性的原文证据,策略模型把证据转成 add/support 图操作,再由确定性结构校验器检查。证据图既是持久工作记忆,也提供 dense process reward。BrowseComp-Plus 上 Qwen3-8B 达 35.9%,同双角色但无 RL 为 26.9%,单体 Agent 为 2.7%。
相较既有工作: 既有深度搜索多优化最终答案,把证据留在线性轨迹里;EviGraph 直接监督“哪条证据支持哪项主张”,使中间过程可验证。
为什么值得关注: RAG 的问题常不是没召回,而是召回内容没有真正影响结论。证据图可用于区分 retrieval recall、证据接纳和最终推理三个故障层。
证据与复现: ⚠️ 预印本、未确认公开代码;实验为公开 benchmark,但 verifier 偏差和逐字证据抽取成本仍需单独评估。
10. StarHarness:用分层搜索演化企业 Agent Harness
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
作者/机构: Esakkivel Esakkiraja、Denis Akhiyarov、Vikas Yadav 等;ServiceNow、Mila、Université de Montréal | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: StarHarness 固定模型权重,搜索 prompt、任务 framing、工具接口、Skill、MCP provider、子 Agent 结构和循环配置。它按基线失败类型分层抽取小型演化池,并严格分开 proposer 可见任务、隐藏选择任务和最终 held-out 任务。三个企业环境中仅接纳 4–12 次修改,就比默认 Harness 提高 20–35 个百分点,且能跨 GPT/Qwen 转移。
相较既有工作: 相比只优化 prompt 或在同一任务集上搜索并汇报,StarHarness 把 Harness 当作可测试、可回滚的代码资产,并用隐藏选择集限制过拟合。
为什么值得关注: 当模型版本迭代收益接近时,瓶颈可能位于工具接口、状态表达和环境约定。该方法适合把 Harness 修改做成小步实验,而不是继续盲目扩大模型。
证据与复现: ✅ 代码已公开,评估包含 held-out 与跨模型转移;⚠️ 仍是预印本,搜索成本与对 proposer 模型的敏感性需要复核。
11. 从 Agent 轨迹学习有限状态机,提前预测失败
Automata from Agent Traces: Failure and Next-Step Prediction
作者/机构: Seonglae Cho、Franklin Cardenoso Fernandez、Umar Mohammed 等;机构未在 arXiv 摘要页确认 | 日期: 2026-08-24(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: 作者把整个轨迹语料压成一个共享 FSM,而非逐条总结成功案例。十二个公开数据集得到 7–43 个状态的小型自动机,held-out replay fitness ≥0.997,构建耗时为毫秒级;FSM 状态上下文在可对齐数据集上超过 Agent Workflow Memory,状态特征的失败预测 AUROC 最高 0.94,并可在任务结束前提前停止。
相较既有工作: 新增的是跨运行的行为拓扑:同一 Harness 下不同模型可能共享相似状态结构,因此监控器不必重新理解完整自然语言轨迹。
为什么值得关注: 这提供了轻量线上监控方案,可把工具调用序列、检索轮次和失败模式映射为状态,再检测死循环、异常跳转或低成功概率路径。
证据与复现: ⚠️ 使用公开轨迹且指标较完整,但未确认公开实现;活动抽取质量、不同 Harness 间的状态迁移仍可能限制泛化。
LLM 训练、推理与系统
本组显示:训练时应关注学习率与参数范数的联合动态,推理时则要针对 Agent 的语义结构和 diffusion 模型的逐步并行特性重做调度。
12. AgentSpec:面向批量 Agent 推理的推测解码
AgentSpec: Speculative Decoding for Batch Inference of LLM Agents
作者/机构: Xin Wang、Ziming Miao、Yi Zhu 等;Ohio State、Microsoft Research、University of Michigan | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、EMNLP 2026 已接收
核心方法与结论: 作者发现常规 speculative decoding 在 batch>32 时可能慢于自回归解码,主要因为跨语义阶段草稿拒绝率高,以及动态 token budget 分配不足。AgentSpec 只在代码块、工具调用等语义一致片段内复用草稿,再按请求冗余度分配剩余预算;在 Reflexion 工作流中草稿拒绝率降至 26.4%,对比 EAGLE-3 的 53.3%,并在不同 batch size 上维持正向 goodput。
相较既有工作: 它不只预测 token 接受率,而是让 Agent Harness 提供结构、query-id 和 agent-id,把上层工作流语义显式传给 vLLM 调度器。
为什么值得关注: 对在线生成式召回也有类比价值:并行候选不是越多越好,应把预算集中到高冗余、合法前缀稳定的请求;不过论文针对文本 Agent,不能直接套到 SID decoder。
证据与复现: ⚠️ 已接收、实验覆盖四个模型家族和 A100,但未确认公开代码;T4 上的加速、显存与批量拐点需要重测。
13. 真实硬件上的 Masked Diffusion LLM 服务特性
Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware
作者/机构: Farhana Amin、Sabiha Afroz、Mona Moghadampanah、Dimitrios S. Nikolopoulos;机构未在 arXiv 摘要页确认 | 日期: 2026-08-24(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: 在单张 H200、LLaDA-8B-Instruct+D2F LoRA 上,请求所需去噪步数落在 11 个离散等级,生成前最好的预测信号 R² 仅 0.150。单请求墙钟时间只有 24% 是 GPU 计算,其余主要是 CPU dispatch;把 batch 16 的请求在每个去噪步共享一次 forward,相对逐请求 dispatch 吞吐提高 16 倍。作者据此主张 dLLM 应围绕“每个 denoising step 的并行”设计 admission 和 eviction。
相较既有工作: 它没有直接照搬 AR serving 的 continuous batching 假设,而是先测真实并发负载,并指出短于 320 token 的 benchmark 会掩盖延迟方差。
为什么值得关注: 工程启示是先定位端到端时间到底花在 kernel、dispatch 还是同步上;在 T4 浅层 Transformer 中,若 Python/图调度占比高,继续优化注意力可能不会改善 p99。
证据与复现: ⚠️ 预印本、无公开代码;仅单一模型、H200、GSM8K/HumanEval,16 倍数字是相对低效逐请求基线,不能直接外推生产吞吐。
14. 有效学习率决定语言模型预训练损失动态
Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining
作者/机构: Zihan Liu、Ruiheng Zheng、Shaobo Zhang 等;机构未在 arXiv 摘要页确认 | 日期: 2026-08-25(8 月 26 日公告) | 类型: 新提交、预印本
核心方法与结论: 论文将有效学习率 ELR 定义为学习率与参数范数的比值,发现当 ELR 轨迹匹配时,即使原始 LR 和参数范数明显不同,损失曲线也会在训练全程近乎重合;平均误差通常只有数个 10^-3,低于代表性设置中的随机种子差异。归一化结构与 LR/范数变化时间尺度决定重合精度;weight decay 和 Hyperball 的作用也主要可由它们诱导的 ELR 轨迹解释。
相较既有工作: 它把 LR schedule、norm control 和 loss scaling 放到一个公共坐标中,而不是把每种优化技巧视为独立机制。
为什么值得关注: 对“改深一层但 loss/效果几乎不变”的模型,可同时记录 LR、全局参数范数和 ELR;若不同版本 ELR 实际接近,训练动态相似并不意外。反之,初始化导致范数剧变时,名义相同 LR 可能对应完全不同的有效步长。
证据与复现: ⚠️ 预印本、未确认公开代码;跨优化器与架构证据较广,但是否适用于 TF1/XDL、加权 NTP 与小规模推荐 Transformer 仍需本地验证。
今日最值得精读的 3 篇
1. TAGR:先把“反馈可靠性”与“业务价值”从正负标签中拆开
推荐理由: 它同时覆盖直播场景、动态 SID、多尺度行为、样本权重和在线推理,是当天与当前生成式主播召回最同构的系统论文。尤其 MF-NTP 与现有 batch weight/label 接口可直接对接,不需要先重写整个模型。
可借鉴实验: 保持两层 SID、RQ-KMeans、Encoder/Decoder 和负样本自然比例不变,做三组:A 为现有正样本 CE;B 为正负混合、仅按 label 定义正 CE 与负抑制 loss;C 在 B 上再加入反馈深度权重,并把短期进入序列与点赞/长停留等辅助行为分通道。关键观察 Recall@K、c1/c2 准确率、同 c1 内区分率、unique-host coverage、正负 loss 梯度范数及 T4 p95/p99。
预期判断: 若 B 不升而 C 升,瓶颈主要是负样本和正样本的可靠性,而非负样本数量;若 c2 与 unique coverage 上升但 Recall 不升,说明局部消歧改善、候选解析或线上集合仍是瓶颈;若三组都不升,再考虑动态 SID 或更强 Encoder。
2. Tlow:检验两层 RQ-KMeans 的层间依赖是不是主要瓶颈
推荐理由: 它提供了与 RQ-VAE/RQ-KMeans 正交的 tokenizer 设计,并保留离散 token 与轻量解码,适合在不先增加 Transformer 深度的前提下定位码本问题。
可借鉴实验: 固定总 token 容量、embedding 来源、训练样本与模型参数,比较 A:现有两层 RQ-KMeans;B:白化/正态化后独立 PQ;C:轻量 flow 变换后独立量化;第二阶段仅给 C 加 codebook-guidance loss。报告每层利用率、组合碰撞率、码字熵、重构误差、同主播日间稳定性、Recall、unique coverage,以及单次并行输出相对自回归 c1→c2 的 T4 延迟。
预期判断: 若 B/C 明显提高码本利用率但推荐不升,问题更可能在用户生成器而非 tokenizer;若 C 只改善新主播与长尾,flow 主要解决分布和冷启动;若并行 token 降低延迟同时 Recall 基本不损失,就有替换两层自回归解码的工程价值。
3. CodeHID:把同前缀负例从二元抑制升级为局部排序监督
推荐理由: 它把 residual quantization、共享前缀、困难负例、rank distillation 与合法路径约束连成完整链路,正好对应当前 c1 高度集中、c2 区分不足和 unique coverage 偏低的问题。
可借鉴实验: 对每个正主播构造同 c1、不同 c2 的候选池;无需控制 batch 内固定正负数,可从全 batch 或缓存池动态取 Top-M。比较 A:现有 token CE;B:CE + 同前缀二元负 loss;C:CE + 基于 teacher 后验分数或停留时长分桶的 listwise/rank-distillation loss。保持总体负 loss 权重一致,观察 c2 条件准确率、合法路径率、同前缀 NDCG、主播去重后 Recall、unique coverage 和训练稳定性。
预期判断: 若 B 优于 A 但 C 不再提升,辨别“正/负”已足够;若 C 显著提升同前缀 NDCG 与 unique coverage,说明自然负样本过于粗糙,需要保留负例间相对强弱;若局部指标升而线上覆盖不升,应继续检查 SID→主播解析、在线集合限制与热度融合。
筛选说明
- 日期口径: 使用 arXiv 官方“Showing new listings for Wednesday, 26 August 2026”公告批次;卡片中另列论文页 v1 日期,因此会出现 8 月 24–25 日。
- 去重规则: 已排除此前早报介绍且本批没有明确实质更新的论文;未用旧论文补数量。
- 主要排除: 仅标题提及 LLM/Agent、缺少可检验方法与实验的概念稿;垂直领域应用但对通用 Agent/LLM/搜广推缺少迁移价值的论文;无 changelog 的普通替换版本。
- 方向覆盖: 本批有较强推荐、广告、生成式检索与 Agent 工程论文;未发现值得单列的高质量竞价机制新稿,广告方向主要由直播生成式广告和淘宝 CTR 表示学习覆盖。