generate-rec-recall/2026-08-25-每日-AI-论文早报-2026-08-25.md

每日 AI 论文早报|2026-08-25

按 arXiv 8 月 25 日公告批次筛选。受周末积压与 UTC 截稿影响,新稿页面主要显示为 8 月 21–24 日提交;另有 4 篇 v2 更新。精选 16 篇,已排除昨天介绍的动态单级码本、DoorDash SID 层级、LiLiCorr 等条目。

一、搜索、广告与推荐系统

1. 从固定 SID 原子到可变长语义子词

Rethinking Item Tokenization in Generative Recommenders: From Fixed Atoms to Semantic Subwords
作者:Xinrui Miao、Mingjia Yin、Jiaqing Zhang 等;中科大、华为。8 月 24 日,新提交;CIKM 2026 论文代码

SST 只压缩历史侧:把 SID 中稳定相邻的原子 token 合并成可变长 subword,目标侧仍生成固定长度 SID;BCA 再注入高频语义前缀转移。相较固定 SID,它明确区分“适合解码的地址”和“适合编码用户历史的表示”,三种生成式推荐 backbone 上相对强基线提升约 3.9%–13.8%。
为什么重要:与你的长历史、两层 SID 和浅 Encoder 高度同构;无需改变线上候选解析。公开代码提升了可复现性,但目前只有公开离线数据。

2. 单向量检索存在指数级表达瓶颈

Retrieval Needs Multivectors: An Exponential Separation
作者:Mihir Agarwal、Viraj Agrawal、Sabyasachi Basu 等;Microsoft Research India。8 月 21 日,新提交、理论与基准预印本

论文首次构造出明确的排序问题:单向量需要指数维度才能把所有相关文档排在不相关文档之前,而多向量只需多项式规模;新的 ANDOR 基准也显示单向量模型微调后改善有限,多向量模型则明显受益。变化在于理论结论针对“排序关系”,而不只是逼近连续相似度。
为什么重要:你当前 embedding 的极低有效秩可能意味着瓶颈不是 codebook 容量,而是单一向量无法同时表达多种用户意图。arXiv 页面未给代码链接,ANDOR 与真实推荐分布仍有距离。

3. 更好的推荐推理文本,不一定带来更好的推荐

The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness
作者:Gustavo Penha、Juan Elenter、Claudia Hauff 等;Spotify。8 月 24 日,新提交;RecSys 2026 workshop 论文

在三个 Amazon 域和统一 Qwen3-1.7B 上,作者控制比较 Title/SID 与轻量/深度 SID 对齐。显式生成自然语言推理会改善可读性,却在标准 SFT、RL 下损害离线推荐;更多 SID 对齐也没有自动转化为更高推荐效果,只有更丰富的奖励能部分修复。
变化与价值:这是对“增加 CoT 就会改善生成式推荐”的重要负结果。规模限于小模型和离线数据,未公开代码。

4. DuELRec:双专家抑制跨域推荐中的负迁移

A Dual-Expert Strategy Integrating LLMs to Mitigate Negative Transfer in Cross-Domain Sequential Recommendation
作者:Hyeongjun Yun、Kihyuk Song、Jaegul Choo、Chung Park。8 月 24 日,新提交;CIKM 2026 论文

一个专家只关注同域历史,另一个读取全部跨域历史;门控动态融合二者。Item-aware attention 将文本子 token 聚合到物品级,双池对比学习再补入单域和跨域协同信号,在十个域上超过 26 种方法。
为什么重要:它把“哪些历史可共享”变成可学习决策,而非默认全部混合。无公开代码和线上实验。

5. CRRN:显式建模触发商品与目标商品的相关性

Cascading Relevance-driven Recommendation Network for CTR Prediction in Trigger-Introduced Recommendation
作者:Kaixuan Chen、Wenwen Wang、Xing Fang 等。8 月 24 日,新提交、工业预印本;代码链接见论文页

CRRN 用个性化门控建模 trigger-target 交互,以级联注意力融合即时意图和长期兴趣,并加入类别辅助 pairwise loss。相较只依赖点击标签的 TIR 模型,它显式约束“推荐结果为什么与当前点击相关”,并报告公开、工业数据及线上 A/B 收益。
证据限制:摘要未披露线上增幅和置信区间。

6. SAHC-NS:按用户候选池动态校准困难负例

SAHC-NS: Structure-Aware and Hardness-Calibrated Negative Sampling for Implicit Collaborative Filtering
作者:Jiayi Wu、Zhengyu Wu、Xunkai Li 等。8 月 24 日更新为 v2、预印本

方法不只看最终 user-item 分数,而用各图聚合层匹配分数的均值和方差刻画整体相关性及结构差异;随后根据每个用户候选池的实际难度调整负例增强强度。相较固定规则采样,它避免所有用户共享同一困难度。
证据限制:无公开代码、无线上实验;arXiv 未提供 v2 changelog,无法确认本次更新的具体增量。

7. TCA:为生成式 DocID 的不同 token 分配不同信用

Token-Level Credit Assignment Optimization for Generative Document Retrieval
作者:Xinpeng Zhao、Yang Liu、Ran Chen 等。8 月 24 日更新为 v2;CIKM 2026 论文

TCA 将生成 DocID 的隐藏状态轨迹与冻结参考模型的 gold 轨迹比较,为不同解码位置构造细粒度奖励;该信用模块可分别接 GRPO 或 PPO。相较把最终文档相关性平均广播到全部 SID token,它能区分哪个前缀或细粒度 token 导致路径偏离。
证据限制:无公开代码及线上结果;v2 无 changelog,实质修订范围不明。

8. TimeRoute:按用户时间状态动态分配多模态权重

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation
作者:Pengyu Zhang、Yangqin Jiang、Klim Zaporojets 等。8 月 24 日更新为 v2、预印本匿名代码

用户时间画像控制文本、图像、音频的个性化融合比例,并通过 FiLM 同时调制长期和短期扩散去噪分支。十次随机种子的实验最高提升 9.8%,且随机时间输入没有收益,说明提升不只是参数增加。
证据限制:仅有离线 TikTok/Amazon 数据;v2 没有公开修改说明。

9. BAR:让广告召回感知实时出价

Bidding-Aware Retrieval for Multi-Stage Consistency in Online Advertising
作者:Bin Liu、Yunfei Liu、Ziru Xu 等;阿里巴巴。8 月 22 日更新、进入本批公告,v2;CIKM 2026 工业论文

BAR 用单调约束和多任务蒸馏把 bid 纳入召回表征,通过异步 near-line 推理刷新广告 embedding,并用任务注意力拆分兴趣和商业价值。阿里展示广告全量部署报告平台收入 +4.32%、正向运营广告曝光 +22.2%。
证据限制:内部数据、出价系统及实验无法复现;v1 到 v2 没有 changelog,因此具体新增内容无法确认。

二、AI Agent、RAG 与长期记忆

10. 在工具执行前控制高风险工具曝光

Risk-Aware Reranking for Agentic Tool Retrieval
作者:Qinfei Li、Xiaoxuan Dong、Jin Zhang 等。8 月 24 日,新提交;CIKM 2026 论文代码与数据

框架分别估计查询相关性与工具暴露风险,再通过可调权重、ToolGraph 平滑和可选规则过滤重排。作者为 UltraTool、Seal-Tools 的 6,108 个工具标注五级风险,将安全边界从“工具调用之后”前移到候选召回阶段。
为什么重要:适合有权限差异、写操作和外部 API 的生产 Agent;不过风险标签和实际业务损失之间仍需重新校准。

11. Compaction Cliff:多轮压缩会快速遗失安全规则

The Compaction Cliff in Long-Running AI Agent Memory
作者:Saber Zerhoudi、Jelena Mitrović、Michael Granitzer;University of Passau、IT:U。8 月 24 日,新提交;CIKM 2026 论文代码

生产压缩提示在一次压缩后仅保留 53% 安全规则,五轮后仅剩 10%。Knowledge Triage 将约束、流程、事实、偏好和事件分别送入不同压缩、分解和检索策略,使五轮规则召回达到 96%。
变化与价值:不再把所有记忆当作同等可损压缩内容;代码和近 40 万条 Agent 配置语料已公开。

12. EARM:检索器也应记住过去的相关性判断

The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory
作者:Qi Feng、Chris Ding、Jicong Fan。8 月 24 日,新提交、预印本

EARM 保存历史 query-memory 的稀疏 LLM relevance 分数,通过因果矩阵补全预测未评分候选,再把少量实时评分与估计分数组合。只直接调用 LLM 评分 17.5% 候选时仍有效,答案准确率相对语义检索最高提升 6.62%。
证据限制:目前只有对话记忆离线实验,未公开代码,也没有长期在线漂移分析。

13. 索引扩容可能造成“准确率看不见的答案漂移”

Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA
作者:Jingjie Ning、Xueqi Li。8 月 24 日,新提交、预印本

Snapshot Compatibility Audit 用跨索引版本的答案差异减去同一版本的随机生成差异,从而隔离真正由语料更新引起的 churn。FineWeb 索引从一片扩到七片后,语义额外漂移达到 10.25 个百分点,但准确率只变化 −1.5 个百分点。
为什么重要:提醒生产 RAG/召回系统:平均 Recall 或准确率稳定,不代表单用户结果兼容。实验预注册较好,但规模只有数百题,无代码。

14. LongWoF-Bench:经过验证的执行经验优于通用 Skill

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
作者:Xiao Zhang、Qumeng Sun、Jihao Li 等。8 月 24 日,新提交、基准预印本

EvoMap 将 verifier 确认成功的轨迹压缩成可复用 Gene;778 个可执行验证任务上,真实演化 Gene 比 Skill 高 8.7–15.5 个百分点,而仅从参考答案蒸馏的 Gene 没有相同收益。
变化与价值:关键不只是“结构化压缩”,而是经验必须来自实际成功执行。未发现公开代码或完整轨迹下载链接。

三、LLM 训练与在线推理系统

15. TailSieve:隔离拖慢整个训练批次的长尾 rollout

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts
作者来自阿里 Qwen、CMU、浙大等。8 月 24 日,新提交、系统预印本

利用历史 partial rollout 判断哪些 prompt 容易产生超长输出,动态划分 tail/bulk 副本并调整资源比例;尾部低并发池还能使用专门的 speculative decoding。单纯路由最高加速 1.67×,结合 MTP/DFlash 后最高 2.59×,同时重新生成被选样本以保持 on-policy。
证据限制:针对 RL/蒸馏 rollout 集群,不等同于普通在线请求;未公开代码。

16. 用结构化后缀加速扩散语言模型

Accelerating Diffusion Language Models via Structured Suffix Modeling
作者:Zifeng Cheng、Keda Li、Zhiwei Jiang 等。8 月 24 日,新提交、预印本代码

将待去噪后缀划分为 local、middle、tail 三段,以不同密度保留 token,并把上一步解码状态带入当前步,避免每次重新初始化全部后缀。方法无需训练,可与并行解码和 KV cache 叠加;长序列组合设置报告最高 72.81× 加速。
证据限制:最高数字来自多种加速技术叠加,不能视为该组件的独立端到端收益。

今天最值得精读的 3 篇

1. Semantic Subword Tokenization

它直接针对“历史侧 SID 展开消耗浅层 Encoder 容量”,比继续扩大码本或盲目增加 Encoder 层更贴近当前瓶颈。
实验建议:保持目标仍为 (c1,c2),只在历史侧将高支持度、低条件熵的 (c1,c2) 合并成单 token,低频 pair 保持两 token。比较固定 SID、仅合并、合并+BCA 三组的 Recall、unique coverage、历史 token 数、同物品 attention 占比和 T4 延迟。

2. Retrieval Needs Multivectors

你的主播 embedding 有效秩很低,论文提示单向量可能无法同时表达语义、协同、时间和视觉意图,增加 codebook 容量也未必能解决。
实验建议:先不重建 SID,令用户塔输出两个兴趣向量——近期/长期,主播保留协同/封面两个向量;使用 max 或轻量门控的 late interaction 合并四个相似度。若 Recall 和尾部覆盖明显提升,再分别量化各子空间。

3. SAHC-NS

它可以把“Encoder 从一层改两层”和“同前缀困难负例”合并成一个诊断实验。
实验建议:升级为两层 Encoder 后,为正主播采样同 c1、不同 c2 的候选;用两层 user-item 分数的均值衡量整体难度、层间差值衡量结构歧义,再按每个用户候选池的分位数动态调整同前缀负例比例。对比固定负例比例,重点观察 Recall、前缀内区分率、unique coverage 和训练稳定性。