paper_type: 实证与评价, Benchmark 与数据集, 方法与系统 type_confidence: 高 reading_depth: 标准精读 title: "CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories" authors: Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi year: 2026 source: arXiv:2606.22454v1, cs.CL preprint, 2026-06-12 pdf: 37_casper_character_variety.pdf tags: [论文精读, 角色刻画, 叙事学, CASPER, 多样性, 自动评估, LLM生成故事] related: [[19_storyalign]], [[25_chinese_literature_homogeneity]], [[21_narrative_flattening]], [[45_style_over_story]], [[30_assessing_creativity]], [[28_automated_creativity_eval]], [[01_lost_in_stories]]
CASPER:LLM 角色真的更单一,还是分类器只看见了某些叙事范式?
一句话答案:CASPER 把主角呈现拆成八组叙事学二元范畴,并在 200 篇 Reddit 人类故事与 4,400 篇模型故事上比较分布;它发现两组故事的多数类画像只在 closure 上不同,细粒度比例中 LLM 主角更常被判为 stylized、dynamic 和 symbolic,但中等人工一致性、只有约 57–84 的分类器 macro-F1、明显的来源与长度差异,使这些结果更适合当作角色呈现的诊断线索,而不是“LLM 角色本质”的定论。
为什么“角色多样”不能只靠人格标签来回答
问题诊断。已有工作常用人格、情绪、性别或社会角色分析故事人物,却很少问人物在叙事中是怎样被呈现的。一个角色可以人格相似,却在一篇故事中是完整成长的主体,在另一篇中只是象征或类型化装置。作者因此没有直接判“扁平/圆形”,而是借用 Hochman 的角色理论,把这一粗标签拆成八组较可操作的对立范畴。(作者主张,§1–3.1)
论文要回答两个层次的问题:LLM 与人类故事中的主角呈现是否不同,以及模型规模、家族、题材和重复采样是否带来角色类型的变化。为此,它先验证自动分类器,再构造题材配对语料,最后比较分类标签分布。只有沿这条链检查,才能知道观察到的是写作差异、测量误差,还是数据设计的混合结果。
先给结论
- 评价框架。CASPER 只分析主角,用 stylization、coherence、wholeness、literalness、complexity、transparency、dynamism、closure 八个主范畴及其反面做二分类。(论文报告,§3.1–3.2,表 1)
- 分类器验证。100 篇测试故事由 4 名受训英语母语学生标注,每篇 2–3 人;总体 Cohen's κ=.56。Llama-70B 在八维上的最终 macro-F1 约为 57.48–84.37,而非人工标注相对最终 gold 的 69.23–92.79。(论文报告,§3.3,附录 B,表 2–4)
- 实验方法。人类语料是 r/shortstories 四个题材各 50 篇;作者为每篇反推 prompt,再用 8 个模型配置生成 4,400 篇故事,其中 7 个开源模型各对每个 prompt 采样 3 次,GPT-4o-mini 各 1 次。(论文报告,§4.1–4.2,附录 C/F)
- 实验结果。按每维多数类组成“平均角色”时,人类与 LLM 只在 closure 上不同;比较比例时,LLM 主角更常被判为 stylized、dynamic,并较少 literal、较多 symbolic。(论文报告,§5,图 3)
- 证据边界。分类器对 LLM 文本的错误率更高,故事长度、模型采样数和来源也不匹配;论文提供的是观察性分布,不是模型规模或家族造成角色差异的因果证据。(阅读者分析)
八组范畴究竟在测什么
| 主范畴 | 对立范畴 | 论文操作化关注点 |
|---|---|---|
| Stylization | Naturalism | 类型化、夸张或艺术加工,还是贴近日常人的呈现 |
| Coherence | Incoherence | 行动、言语与内在动机是否形成一致模式 |
| Wholeness | Fragmentariness | 人物是否作为完整整体出现,还是只呈现局部切面 |
| Literalness | Symbolism | 只是故事世界中的个体,还是也承载主题与抽象意义 |
| Complexity | Simplicity | 是否有多层、冲突的欲望与动机 |
| Transparency | Opacity | 思想、情感与动机是否对读者清楚可见 |
| Dynamism | Staticism | 故事过程中是否发生明显转变 |
| Closure | Openness | 人物弧是否明确解决,还是留下命运与意义的开放问题 |
这些维度描述的是呈现方式,不是文学质量方向。stylized 不一定差,closed 不一定俗套,symbolic 也不自动比 literal 深刻。二元化便于规模统计,却压掉“局部开放、整体收束”或“行为透明、深层动机仍含混”等连续状态。(论文报告,§3.1,表 1;阅读者分析)
CASPER 分类器怎样选出来
人工测试集。作者从 r/WritingPrompts 取 50 篇人类故事及其 prompt,再用 GPT-4o-mini 生成 50 篇配对故事。4 名美国本科或研究生标注者接受叙事理论训练,每篇由两人先标,分歧时第三人裁决,总计 800 个 gold 标签。总体 κ=.56;各维 κ 从 coherence 的 46.1 到 dynamism 的 83.6,说明部分概念连人类也难稳定区分。(论文报告,§3.3,附录 B.2,表 2)
模板筛选。作者用 Llama-70B 比较逐维与一次八维、zero-shot 与 ICL、Likert 与二分类等模板,最终采用逐维二分类,并为不同维度选模板。Table 4 报告最终 Llama-70B macro-F1:stylization 68.47、coherence 62.99、wholeness 57.48、literalness 60.81、complexity 61.69、transparency 60.10、dynamism 84.37、closure 75.12。(论文报告,§3.3,附录 B.3,表 3–4)
这里存在可复现性问题:正文说 coherence、wholeness、complexity、transparency 用 ICL-interleaved,literalness 用 ICL-basic;Table 3 的数值与 Table 4 的“最终 CASPER”数值却在其中多维对不上。代码可能消除歧义,但只按 PDF 无法确定实际批量实验逐维用了哪套模板。(阅读者分析)
容易混淆的两个 F1。Table 2 的 69.23–92.79 是单个人工标注与最终 gold 的 macro-F1,不能当作自动分类器性能;最终 Llama-70B 是 Table 4 的 57.48–84.37。旧笔记若把前者写成 CASPER 准确率,会明显高估测量可靠性。(阅读者分析)
方向性误差。在测试集中,分类器会低估 stylized 和 closed,夸大 literal;它与 gold 的逐维分歧率在 LLM 故事上也普遍高于人类故事,例如 stylization 为 .30 对 .11,closure 为 .22 对 .07。因而核心人机差异并不是由一个对两类文本同样准确的量尺测得。(论文报告,附录 B.3,表 5–6)
4,600 篇语料是怎样构成的
人类语料。作者从最近一年 r/shortstories 投稿中筛选 Domestic、Romance、Science-Fiction/Fantasy、Suspense/Thriller 各 50 篇,共 200 篇。它们先经作者题材标签、Llama-70B 题材复核,以及 Binoculars 和 Copyleaks 的 AI 检测,以降低题材错配和机器文本混入。(论文报告,§4.1,附录 E/G)
prompt 配对。Llama-70B 为每篇人类故事反推一个应能明显生成该故事、且匹配题材的 writing prompt,作者再人工检查。这样可让模型故事与人类故事共享主题入口,却也可能把原故事的结构或人物弧泄漏进 prompt;它不是从独立 prompt 随机抽取的人机对照。(论文报告,§4.1;阅读者分析)
模型生成。8 个配置来自 GPT、Llama、Phi、Mistral 四个家族:GPT-4o-mini;Llama 3.2-3B、3.1-8B、3.3-70B;Phi-3 4B/14B;Mistral 7B/24B。7 个开源模型对 200 个 prompt 各采样 3 次,得到 4,200 篇;GPT-4o-mini 各生成一次,得到 200 篇,总计 4,400。开源模型 temperature=.7、top-p=.9,GPT 使用默认参数。(论文报告,§4.2,附录 C/F,表 7–8)
人类与 LLM 角色究竟哪里不同
多数类画像。作者先对每一维取占比至少 50% 的标签。人类“平均主角”为 natural、coherent、whole、literal、complex、transparent、dynamic、open;LLM 平均主角只有最后一维变成 closed。这里的“只差 closure”是两个八位多数类向量的比较,不是“只有 closure 通过显著性检验”。(论文报告,RQ1,§5)
细粒度比例。不把分布压成多数类后,LLM 主角被判为 stylized 和 dynamic 的比例显著更高,也更少 literal、因而更 symbolic。作者把它解释为模型偏好原型化、明显成长并带主题寓意的人物;人类与 LLM 都大量生成 coherent、whole、transparent 的主角。(论文报告,RQ2,图 3)
数据支持“在 CASPER 标签下存在这些比例差”,却不支持“LLM 角色更好、更复杂”或“人类更有艺术自由”的价值结论。特别是 closure 分类器本身低估 closed,且对 LLM 文本错误更多;人机差异的真实幅度和方向需要更可靠的人工复核。(阅读者分析)
规模、家族、题材和重复采样告诉了什么
模型规模。以 14B 为界汇总后,大模型与中小模型的八维分布接近,小模型只多约 10.2% stylized。模型并非随机分配到规模组,家族、训练和输出长度同时变化,所以只能说这批配置未显示稳定规模趋势。(论文报告,RQ3,图 4;阅读者分析)
模型家族。按家族内模型的标签分布标准差,作者称 Phi 最多样、Llama 最少样;Mistral 更 stylized、较少 coherent 和 closed。这里的“多样”是少量家族成员之间的分布变异,GPT 甚至只有一个模型,不是单个模型在同一 prompt 下的角色覆盖率,也没有控制家族规模与采样量。(论文报告,RQ4,图 5;阅读者分析)
题材。Domestic 更 natural,Sci-Fi/Fantasy 更 stylized 和 symbolic,Romance 多为 coherent、whole、transparent;相似模式也出现在人类语料中。题材确实与标签共变,但不应把题材适配误写成模型本身的固定偏好。(论文报告,RQ5,图 6、附录 H.1)
重复采样。同一 prompt 对同一开源模型生成三次时,八维三次标签完全相同的 prompt 比例依次为 30%、22%、27.5%、13.5%、53.5%、45.5%、35.5%、3%。closure 和 literalness 尤其不稳定,说明单次生成不足以代表一个模型的固定角色风格;这个数字衡量采样一致性,不是分类准确率。(论文报告,RQ6,附录 H.2,图 10)
哪些混杂会改变解释
文本长度。人类 r/shortstories 平均 1,502.57 tokens;模型均值从 Mistral-7B 的 560.83 到 Llama-70B 的 1,027.53。更长文本有更多空间呈现复杂动机、变化和开放伏笔,也有更多机会完成角色弧;论文没有做长度匹配或回归控制。(论文报告,附录 F,表 8;阅读者分析)
不平衡采样。每个人类 prompt 只有一篇人类故事,开源模型各有三篇、GPT 只有一篇;4,400 个模型文本还共享 200 个 prompt,并非 4,400 个独立主题。若统计把故事都当独立样本而不建模 prompt 聚类,会夸大有效样本量。(阅读者分析)
来源与检测。“人类故事”来自 Reddit,AI detector 不能保证完全排除机器辅助;自动域分类器在两个 subreddit 间只有 24.52 macro-F1,只能说明该分类提示表现很差,不能严格证明两个来源同分布。平台可公开访问也不等于作者对再分发和模型分析有明确知情同意。(论文报告,Limitations、附录 E;阅读者分析)
适用范围。论文只覆盖英文、prompt 驱动短篇和主角,不代表长篇小说、编辑出版文本、多语言写作或配角群像。八个维度来自特定叙事理论,移植到中文、网文或非虚构文本前需要重新标注和校准。(论文报告,§7、Limitations;阅读者分析)
原文定位(附录)
- 研究问题与贡献:Abstract、§1,PDF pp.1–2。
- 八组范畴与任务定义:§3.1–3.2,表 1,PDF pp.3–4。
- 分类器开发:§3.3,PDF pp.4–5;附录 B,PDF pp.19–23。
- 人类与模型语料构造:§4,PDF pp.5–6;附录 C、E–G,PDF pp.22–25。
- 六组研究问题与结果:§5–6,图 3–6,PDF pp.6–8;附录 H,PDF pp.25–26。
- 局限:PDF p.9。
读完后的判断
CASPER 的价值不在于给角色质量算一个总分,而在于把“角色扁平”拆成八个可以逐项讨论的呈现问题。对写作系统,它最适合作为诊断面板:检查主角是否总被写成类型化人物、是否每次都成长、是否所有人物弧都封闭、是否用象征替代了具体的人。八维不能直接相加,目标分布还应随题材和作者意图改变。
对论文的人机比较则应保持中等偏低信心。框架有理论来源,语料构建也努力控制题材,但量尺仍不够稳定,PDF 对最终模板的说明互相矛盾,文本长度和聚类结构没有控制。下一步最关键的不是再扩几万篇自动标签,而是做长度与 prompt 匹配的分层抽样、对核心差异进行盲法人工复核、报告 cluster-aware 置信区间,并检验八维是否真的预测读者感受或作品质量。