paper_type: 实证与评价, 理论与立场 type_confidence: 高 reading_depth: 标准精读 title: AI Fiction in the Wild authors: Neel Gupta; Maria Antoniak; Melanie Walsh year: 2026 source: arXiv:2606.22748v2;provisionally forthcoming in Modern Fiction Studies pdf: 36_ai_fiction_in_the_wild.pdf tags: [论文精读, AI小说, WildChat, 用户行为, Fanfiction, 文化研究] related: [[31_narra_gym]], [[21_narrative_flattening]], [[45_style_over_story]], [[37_casper_character_variety]]
AI Fiction in the Wild:34% 的小说会话,实际上由极少数用户推动
一句话答案:WildChat 日志可靠地显示,小说请求高度集中于少数 power users,且 fanfiction、explicit fiction 和同 prompt 反复生成非常常见;但日志只观察到“请求生成”,没有观察阅读、享受、分享或孤独,因此“solipsistic reader-writer”应被视为研究假说,而不是已证实的用户心理。
为什么“34% 的会话在写小说”容易被误读
大规模聊天日志可以告诉我们平台上发生了多少生成,却未必告诉我们有多少人在这样使用。一个极活跃用户可以创建数千次会话,使流量占比看起来像普遍行为;同样,用户请求故事也不等于真正读完、享受或独自消费故事。
这篇论文的核心问题有两层:真实用户怎样反复请求 AI fiction,这些行为又能否支持一种新的读者—作者关系理论? 作者先用 WildChat 做观察性日志研究,再借文学史、平台研究、fanfiction、重复消费和 pornography 文献提出“solipsistic reader-writer”。下文先核对 34% 是怎样算出的,再看用户去重和重复 prompt 如何改变解释,最后判断数据与文化理论之间还有多远。
先给结论
- 数据规模。573,453 条英语 WildChat 会话中,GPT-o4-mini 将 195,271 条判为 fiction,占 34%;fiction 子集中 fanfiction 为 95,450 条(49%),explicit 为 52,231 条(27%)。(论文报告,§4)
- 用户集中度。fiction 子集中约 2% 的估计用户贡献超过 80% 的会话;每名估计用户只保留一条后,fiction 占比从 34% 降到 7.1%。(论文报告,§4,表 4–5)
- 重复行为。至少有两条 fiction 会话的 4,413 名估计用户,平均重复 prompt 率为 42%;top 2% 为 69%,最活跃 10 人为 85%。(论文报告,§5)
- 证据边界。这些数据足以证明请求行为高度集中和重复,却不足以证明用户阅读体验、社会隔离、成瘾或人类作者“他者”已经消失。(阅读者分析)
34% 是怎样从公开日志里识别出来的
数据来源。研究使用第一版 WildChat 的 573,453 条英语 conversation,采集时间为 2023 年 4 月至 2024 年 5 月。WildChat 在 Hugging Face Spaces 上提供免费 GPT-3.5/GPT-4 聊天界面,用户无需 OpenAI 账号,并两次同意会话可公开用于研究。原始数据超过 100 万条、多语言;本文只分析英语子集。(论文报告,§3)
数据伦理。数据带有 hashed IP 和由 IP 推断的地区。原作者做过自动 PII 清理,但后续研究仍发现敏感信息并促使再次清理。本文没有申请 UW IRB,理由是数据已经公开。(论文报告,§3)明确同意提高了数据的研究可用性,却没有自动消除敏感内容再曝光和用户是否理解公开后果的问题。(阅读者分析)
分类方法。作者先用非小说词典排除明显编程、翻译和求职会话,再把每段会话的前三次 exchange 交给 GPT-o4-mini,同时判断 fiction、fanfiction 和 sexually explicit。fiction 定义较宽,包括 imaginative、speculative、not grounded in real-world facts、roleplay 和 alternate history。(论文报告,§4)
分类验证。三名作者独立标注 300 条随机会话,平均 pairwise Cohen's κ 为 fiction 0.90、fanfiction 0.82、explicit 0.80。分类器的 precision/recall/F1 分别为:fiction 0.97/0.94/0.95,fanfiction 0.94/0.85/0.89,explicit 0.84/0.69/0.76。较高 precision 和较低 recall 表明后两类计数更可能低估。(论文报告,§4,表 1–3)
测量边界。分类方向总体可靠,但只看前三轮会漏掉后期转入故事生成的会话,宽定义也把角色扮演、假想场景和完整小说请求放在一起。因此 34% 描述的是这套定义下的会话流量,不能直接改写成“34% 的用户在写小说”。要理解普及程度,必须把会话重新还原到用户层面。(阅读者分析)
从会话流量回到用户,图景怎样改变
用户层结果。fiction 子集中约 2% 的用户贡献超过 80% 会话。作者基于 IP 合并,将 12,947 个独立 IP 估计为 10,082 名用户;若每名估计用户只保留一个 conversation,fiction 比例从 34% 降至 7.1%。类别并不互斥;全部英语会话中 explicit 为 57,724 条(10%),fiction 子集中 explicit 为 52,231 条(27%),fanfiction 为 95,450 条(49%),toxic 为 67,744 条(35%)。(论文报告,§4,表 4–5)
口径解释。34% 与 7.1% 并不矛盾:前者回答 fiction 占多少流量,后者更接近有多少估计用户至少发起过一次 fiction 会话。IP 合并仍可能把共享网络下的多人当成一人,或把使用多个 IP 的一人拆开,但它已经证明总量主要受少数高频用户推动。(阅读者分析)
重复率方法与结果。作者把 opening prompt 用 all-MiniLM-L6-v2 embedding 表示,再以 DBSCAN 聚类,参数为 cosine distance epsilon=0.1、min_samples=2。重复率定义为 1 - prompt clusters / fiction conversations。在至少有两条 fiction 会话的 4,413 名估计用户中,平均重复率为 42%;conversation 数 top 2%(n=88)为 69%,最活跃 10 人为 85%。(论文报告,§5)
行为画像。作者据此描述两类极端行为:story cyclers 会在一段时间内反复生成同一故事的变体,再转向新主题;infinite story demanders 会长时间重复同一或高度相似的请求。一个高频用户在数月内数千次启动近似的 Doki Doki Literature Club! 生育情节;另一人在 11 个月产生 900 多个会话,并反复回到 Meredith Lexington 时间旅行故事。(论文报告,§5,图 2–4)
这些案例说明 LLM 支持细粒度、即时和重复的按需变体,但它们是有数据锚点的解释性类型,不是预注册聚类得到的稳定人群。到这里,日志研究已经回答了“用户怎样请求生成”;下一步的理论命题却要求知道这些请求在人类经验中意味着什么。
从重复生成到“孤独的读者—作者”,证据跨了哪一步
经验观察。常见请求会指定角色关系、人格、服装、场景和结局等细粒度组合。(论文报告,§6)
作者解释。LLM 把 AO3 式标签检索推进为自然语言即时定制:用户可以固定大尺度选择,让模型反复排列小尺度实现。(作者主张,§6)
理论主张。作者由此提出一条理论链:部分用户同时指定并获取故事;作者和读者角色可能折叠到同一人;如果故事在封闭人机循环中生成和消费,传统小说中的自主“人类他者”会消失,形成 solipsistic reader-writer;这种即时、重复、私密和按需满足又与 pornography 消费具有结构相似性。(作者主张,§6–7)
推断边界。这条链的第一步有行为数据,后面几步仍是理论解释。WildChat 不知道用户是否完整阅读输出、为什么重开会话、屏幕前是否多人共创、是否为写作或桌游准备素材,也不知道作品是否被分享和发布。pornography 类比可以提出研究问题,却不能脱离限定语去病理化 fanfiction、erotica、角色扮演或普通故事生成。(阅读者分析)
因此,论文最有启发的理论贡献不是证明了一种新型孤独,而是把后续研究问题说得更具体:当生成与消费在同一界面发生时,作者性、他者性和重复需求应如何通过访谈、问卷与民族志被直接观察?
伦理与有效性边界如何改变结论强度
代表性边界。WildChat 用户可能比普通 ChatGPT 用户更技术化、更在线,也可能因免费、免登录和较少限流而构成特殊群体;作者明确说明数据不代表所有 ChatGPT 用户。用户人口特征、动机、真实阅读、内容传播方式也都未知,并呼吁后续使用访谈、问卷和民族志。(论文报告,§3、§7)
有效性边界。fiction 占比按会话而非用户加权,power users 对总量影响巨大;前三轮分类和宽 fiction 定义限制了跨平台比较;IP 与相似 prompt 合并存在拆分和误合并风险。观察性日志只能支持行为模式和关联,不能识别 LLM 是否造成孤独、市场替代、文化同质化或强迫性使用。(阅读者分析)
这些限制没有削弱“大量重复生成确实存在”的事实,却把文化结论从实证发现降为待检验的研究议程。对系统设计而言,日志更直接支持的是分支比较、细粒度约束、长期记忆、隐私和内容边界,而不是任何关于用户心理状态的诊断。
原文定位(附录)
- 核心理论命题与研究贡献:PDF pp.1–4。
- WildChat 来源、同意与代表性:§3,PDF pp.5–7。
- 分类方法与人工验证:§4,PDF pp.7–8,表 1–3。
- 34% 与 power-user 去重口径:§4,PDF pp.8–9,表 4–5。
- 重复率、聚类和用户画像:§5,PDF pp.9–15,图 2–4。
- Fanfiction 与 erotica:§6,PDF pp.15–17。
- 理论边界与后续研究:§7,PDF p.17。
- 完整分类 prompt:Appendix A,PDF p.23。
- 常见 IP 与去重后的变化:Appendix D,PDF p.26。
读完后的判断
这篇论文对开头两层问题给出了强弱不同的答案。对“真实用户怎样请求 AI fiction”,它提供了目前很有价值的日志证据:最强发现是 34% 的会话流量在用户去重后降到 7.1%,并与 42%–85% 的重复率梯度共同证明少数高频用户和反复变体塑造了整体图景。对“这是否形成 solipsistic reader-writer”,证据则明显不足,因为消费、动机、社会关系和传播都没有被观察。
读完后应更新的认识是:AI fiction 的真实需求未必是一次生成“最好的一篇”,而可能是对同一约束空间反复采样、比较和微调。对当前项目而言,这直接支持可保存分支、参数化角色关系、长期记忆和版本比较,同时要求更强的隐私、内容边界与强迫性使用保护。至于“人类作者的他者已经消失”,目前只能作为后续用户研究要检验的命题,不能作为产品或文化判断的既成事实。