生成式召回研究增量周报|2026-08-31
本期检查 2026 年 8 月 31 日 arXiv 公告批次,共精选 4 篇。没有发现新的 SID、向量量化或生成式解码专项工作;最强信号来自索引与表示层:动态时间过滤、选择性多模态对齐,以及用粗粒度召回加细粒度 late interaction 控制在线成本。
本期核心判断
- 今天最值得迁移的不是新的生成器结构,而是 TiGER 与 PULSAR 展示的两阶段在线设计:先用结构化索引或压缩表示缩小候选,再执行更精细的匹配。
- 多模态内容并非越多越好。AMUR 与上期 PailitaoGR 指向相同问题:弱相关模态和视觉噪声会污染用户兴趣或 SID 表示,应显式选择而非直接拼接。
- 对当前两层 SID,优先建立“动态 ANN + 多模态轻量 scorer”对照,有助于判断低 unique coverage 来自内容表示、索引新鲜度,还是生成解码本身。
第一优先级:直接影响召回与在线索引
1. TiGER:支持任意时间区间的版本化统一图索引
类型: arXiv 预印本;未确认公开代码
A Versioned Unified Graph Index for Dynamic Timestamp-Aware Nearest Neighbor Search
真正新增: TiGER 将不同时间版本的连边整合进一个图索引,使任意时间区间查询可以直接沿有效连边搜索,不需要先召回再过滤,也不需要为每个时间分段建立独立子图。作者将这一结构称为 integrated versioned connectivity。
主要结果: 相比后过滤和分段子图基线,论文报告 QPS 最高提升 5 倍且检索准确率基本不损失。摘要没有披露数据规模、具体硬件和尾延迟,暂不能直接外推到直播生产环境。
为什么重要: 直播主播集合具有强时间约束:开播、关播、商品状态和内容版本都持续变化。若先生成 SID 再按在线集合过滤,模型概率可能大量浪费在已经失效的候选上;时间感知索引可作为生成式召回的并行通道或候选校验层。
建议实验: 保持现有生成器不变,构建带 valid_from/valid_to 的主播 ANN 快照,对比 A:当前在线集合后过滤;B:按小时分片索引;C:统一版本化索引。统一候选规模,观察 Recall、无效候选率、unique coverage、QPS、p95/p99 和索引更新时间。
证据与复现: ⚠️ 仅预印本、未确认代码;5 倍 QPS 是作者离线实验结果,缺少生产 A/B。
2. PULSAR:先用压缩表示召回,再用细粒度 MaxSim 精排
类型: EMNLP 2026 Industry Track 已接收;生产系统报告
PULSAR: Pooled Unified Late-Interaction Search and Retrieval for Enterprise Visual Document RAG
真正新增: PULSAR 以视觉页面多向量为基础,先用紧凑 pooled summary 做第一阶段召回,再对少量候选使用更细粒度 pooled representation 执行精确 MaxSim。这样保留 late interaction 的局部匹配能力,同时避免全库读取全部 token 向量。
主要结果: 在 ViDoRe V3 上,中位向量检索延迟相对未池化方案降低 15.1 倍,NDCG@10 与 Recall@10 绝对损失低于 0.01;并发下 QPS 约提高 88 倍。生产中位向量检索延迟为 156 ms,系统已覆盖约 240 万页。
为什么重要: 它为主播多向量召回提供了可落地模板:粗粒度主播摘要负责大规模候选生成,封面局部、文本、语言或动态内容向量只在 Top-M 上做 late interaction。该路线也可作为 SID 生成召回的 verifier。
建议实验: 用户侧输出近期/长期两个兴趣向量,主播侧保留身份/封面两个向量;A 使用单向量 ANN,B 使用压缩摘要召回,C 在 B 的 Top-M 上增加 max/MaxSim 重排。报告 Recall、长尾与 unique coverage、额外显存、T4 p95/p99,并扫描 M=50/100/200。
证据与复现: ⚠️ 已接收且有真实生产规模,但无公开代码;88 倍 QPS 相对未池化基线,不能直接视为相对成熟 ANN 的收益。
第二优先级:表示选择与轻量建模
3. AMUR:只对齐真正与用户兴趣相关的模态信息
类型: CIKM 2026 已接收;代码公开
Information-Guided Selective Modality-Interest Alignment for Multimodal Recommendation · 代码
真正新增: AMUR 不默认文本、图像等模态都应被等权融合,而是从信息论角度增强与用户兴趣相关的模态共享信息,同时抑制弱相关信号,并保留模态特有的互补信息。实现上先用行为信号修正模态图,再做选择性跨模态对齐。
主要结果: 作者在三个公开数据集上报告优于多种多模态推荐基线,但摘要没有给出绝对指标、延迟或线上 A/B。代码基于公开 MMRec 框架,具备离线复现基础。
为什么重要: 这直接对应主播内容 embedding 中“大量特征与当前用户无关”的问题。若将所有内容特征直接 concat 后做 RQ-KMeans,码本可能优先编码强方差但弱偏好的信息,降低同前缀内的行为一致性。
建议实验: 在重建 SID 前训练一个轻量 modality gate,只允许用户行为可解释的视觉/文本/语言分量参与融合;对比等权融合、全局固定权重和用户条件门控。观察量化误差、每层码本熵、同前缀行为纯度、Recall 与 unique coverage。
证据与复现: ✅ CIKM 2026 已接收并公开代码;⚠️ 仅公开离线数据,无线上结果和生成式 SID 实验。
4. HubMixer:用少量潜在 Hub 处理异构特征交互
类型: 工业预印本;快手线上自报;未确认公开代码
HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation
真正新增: HubMixer 不让用户、物品、行为、上下文和业务 token 在原始异构空间中全量互相混合,而是先通过 cross-attention 归纳到少量 learnable hubs,在更干净的潜空间完成高阶交互,再让原 token 有条件地读取 Hub 结果。
主要结果: 作者报告多个工业离线任务优于强基线,并在快手短视频招聘业务中带来简历投递转化率 +5.48%,已完成生产部署。摘要未披露参数量、具体延迟、消融细节和代码。
为什么重要: 对浅层 Encoder,这比简单从 1 层增加到 2 层更有诊断价值:模型可能不是深度不足,而是所有历史 SID、action 和用户属性被无差别混合。少量 Hub 可以限制交互路径并控制 T4 成本。
建议实验: 保持 Encoder 层数为 1,将历史 SID、action 和用户属性压入 4/8/16 个 Hub,再回写到历史 token;对比原始 self-attention 和直接两层 Encoder。报告 Recall、unique coverage、Hub 使用熵、参数量、显存与 T4 p99。
证据与复现: ⚠️ 工业自报、无公开代码;线上任务是招聘转化,不是生成式主播召回。
本期建议优先级
- 先做 PULSAR 式 Top-M verifier: 不改 SID 和主生成器,仅增加多向量轻量重排,判断低覆盖是否能被局部交互修复。
- 再做 AMUR 式 modality gate: 在量化前剔除与行为弱相关的内容分量,观察同前缀纯度是否改善。
- 建立时间索引诊断: 分开记录生成器命中、在线有效性和索引新鲜度,避免将无效主播过滤损失归因给模型。
- HubMixer 最后测试: 若现有一层 Encoder 对用户属性/action 利用率低,再用少量 Hub 替代直接加深网络。
筛选说明
- 日期口径: 收录进入 arXiv 2026 年 8 月 31 日公告列表、且未在 8 月 30 日增量周报中介绍的工作。
- 去重: 未重复 PailitaoGR、自刷新目录检索、多哈希 GNN、PrismRec、Tlow、SST、TAGR、CodeHID、PUMA 与 AsymSpec。
- 相关性边界: 本期没有直接命中 SID、RQ-VQ 或生成式 decoder 的高质量新稿;4 篇均按对当前召回系统的可迁移工程价值收录,并明确标注间接性。
- 排除项: 普通 CTR/排序结构、Agentic Search、通用 RAG 与缺少召回迁移价值的垂直应用。