AI_writing/pdfs/37_casper_character_variety_精读.md

paper_type: 实证与评价, Benchmark 与数据集, 方法与系统 type_confidence: 高 reading_depth: 标准精读 title: "CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories" authors: Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi year: 2026 source: arXiv:2606.22454v1, cs.CL preprint, 2026-06-12 pdf: 37_casper_character_variety.pdf tags: [论文精读, 角色刻画, 叙事学, CASPER, 多样性, 自动评估, LLM生成故事] related: [[19_storyalign]], [[25_chinese_literature_homogeneity]], [[21_narrative_flattening]], [[45_style_over_story]], [[30_assessing_creativity]], [[28_automated_creativity_eval]], [[01_lost_in_stories]]

CASPER:LLM 角色真的更单一,还是分类器只看见了某些叙事范式?

一句话答案:CASPER 把主角呈现拆成八组叙事学二元范畴,并在 200 篇 Reddit 人类故事与 4,400 篇模型故事上比较分布;它发现两组故事的多数类画像只在 closure 上不同,细粒度比例中 LLM 主角更常被判为 stylized、dynamic 和 symbolic,但中等人工一致性、只有约 57–84 的分类器 macro-F1、明显的来源与长度差异,使这些结果更适合当作角色呈现的诊断线索,而不是“LLM 角色本质”的定论。

为什么“角色多样”不能只靠人格标签来回答

问题诊断。已有工作常用人格、情绪、性别或社会角色分析故事人物,却很少问人物在叙事中是怎样被呈现的。一个角色可以人格相似,却在一篇故事中是完整成长的主体,在另一篇中只是象征或类型化装置。作者因此没有直接判“扁平/圆形”,而是借用 Hochman 的角色理论,把这一粗标签拆成八组较可操作的对立范畴。(作者主张,§1–3.1)

论文要回答两个层次的问题:LLM 与人类故事中的主角呈现是否不同,以及模型规模、家族、题材和重复采样是否带来角色类型的变化。为此,它先验证自动分类器,再构造题材配对语料,最后比较分类标签分布。只有沿这条链检查,才能知道观察到的是写作差异、测量误差,还是数据设计的混合结果。

先给结论

八组范畴究竟在测什么

主范畴 对立范畴 论文操作化关注点
Stylization Naturalism 类型化、夸张或艺术加工,还是贴近日常人的呈现
Coherence Incoherence 行动、言语与内在动机是否形成一致模式
Wholeness Fragmentariness 人物是否作为完整整体出现,还是只呈现局部切面
Literalness Symbolism 只是故事世界中的个体,还是也承载主题与抽象意义
Complexity Simplicity 是否有多层、冲突的欲望与动机
Transparency Opacity 思想、情感与动机是否对读者清楚可见
Dynamism Staticism 故事过程中是否发生明显转变
Closure Openness 人物弧是否明确解决,还是留下命运与意义的开放问题

这些维度描述的是呈现方式,不是文学质量方向。stylized 不一定差,closed 不一定俗套,symbolic 也不自动比 literal 深刻。二元化便于规模统计,却压掉“局部开放、整体收束”或“行为透明、深层动机仍含混”等连续状态。(论文报告,§3.1,表 1;阅读者分析)

CASPER 分类器怎样选出来

人工测试集。作者从 r/WritingPrompts 取 50 篇人类故事及其 prompt,再用 GPT-4o-mini 生成 50 篇配对故事。4 名美国本科或研究生标注者接受叙事理论训练,每篇由两人先标,分歧时第三人裁决,总计 800 个 gold 标签。总体 κ=.56;各维 κ 从 coherence 的 46.1 到 dynamism 的 83.6,说明部分概念连人类也难稳定区分。(论文报告,§3.3,附录 B.2,表 2)

模板筛选。作者用 Llama-70B 比较逐维与一次八维、zero-shot 与 ICL、Likert 与二分类等模板,最终采用逐维二分类,并为不同维度选模板。Table 4 报告最终 Llama-70B macro-F1:stylization 68.47、coherence 62.99、wholeness 57.48、literalness 60.81、complexity 61.69、transparency 60.10、dynamism 84.37、closure 75.12。(论文报告,§3.3,附录 B.3,表 3–4)

这里存在可复现性问题:正文说 coherence、wholeness、complexity、transparency 用 ICL-interleaved,literalness 用 ICL-basic;Table 3 的数值与 Table 4 的“最终 CASPER”数值却在其中多维对不上。代码可能消除歧义,但只按 PDF 无法确定实际批量实验逐维用了哪套模板。(阅读者分析)

容易混淆的两个 F1。Table 2 的 69.23–92.79 是单个人工标注与最终 gold 的 macro-F1,不能当作自动分类器性能;最终 Llama-70B 是 Table 4 的 57.48–84.37。旧笔记若把前者写成 CASPER 准确率,会明显高估测量可靠性。(阅读者分析)

方向性误差。在测试集中,分类器会低估 stylized 和 closed,夸大 literal;它与 gold 的逐维分歧率在 LLM 故事上也普遍高于人类故事,例如 stylization 为 .30 对 .11,closure 为 .22 对 .07。因而核心人机差异并不是由一个对两类文本同样准确的量尺测得。(论文报告,附录 B.3,表 5–6)

4,600 篇语料是怎样构成的

人类语料。作者从最近一年 r/shortstories 投稿中筛选 Domestic、Romance、Science-Fiction/Fantasy、Suspense/Thriller 各 50 篇,共 200 篇。它们先经作者题材标签、Llama-70B 题材复核,以及 Binoculars 和 Copyleaks 的 AI 检测,以降低题材错配和机器文本混入。(论文报告,§4.1,附录 E/G)

prompt 配对。Llama-70B 为每篇人类故事反推一个应能明显生成该故事、且匹配题材的 writing prompt,作者再人工检查。这样可让模型故事与人类故事共享主题入口,却也可能把原故事的结构或人物弧泄漏进 prompt;它不是从独立 prompt 随机抽取的人机对照。(论文报告,§4.1;阅读者分析)

模型生成。8 个配置来自 GPT、Llama、Phi、Mistral 四个家族:GPT-4o-mini;Llama 3.2-3B、3.1-8B、3.3-70B;Phi-3 4B/14B;Mistral 7B/24B。7 个开源模型对 200 个 prompt 各采样 3 次,得到 4,200 篇;GPT-4o-mini 各生成一次,得到 200 篇,总计 4,400。开源模型 temperature=.7、top-p=.9,GPT 使用默认参数。(论文报告,§4.2,附录 C/F,表 7–8)

人类与 LLM 角色究竟哪里不同

多数类画像。作者先对每一维取占比至少 50% 的标签。人类“平均主角”为 natural、coherent、whole、literal、complex、transparent、dynamic、open;LLM 平均主角只有最后一维变成 closed。这里的“只差 closure”是两个八位多数类向量的比较,不是“只有 closure 通过显著性检验”。(论文报告,RQ1,§5)

细粒度比例。不把分布压成多数类后,LLM 主角被判为 stylized 和 dynamic 的比例显著更高,也更少 literal、因而更 symbolic。作者把它解释为模型偏好原型化、明显成长并带主题寓意的人物;人类与 LLM 都大量生成 coherent、whole、transparent 的主角。(论文报告,RQ2,图 3)

数据支持“在 CASPER 标签下存在这些比例差”,却不支持“LLM 角色更好、更复杂”或“人类更有艺术自由”的价值结论。特别是 closure 分类器本身低估 closed,且对 LLM 文本错误更多;人机差异的真实幅度和方向需要更可靠的人工复核。(阅读者分析)

规模、家族、题材和重复采样告诉了什么

模型规模。以 14B 为界汇总后,大模型与中小模型的八维分布接近,小模型只多约 10.2% stylized。模型并非随机分配到规模组,家族、训练和输出长度同时变化,所以只能说这批配置未显示稳定规模趋势。(论文报告,RQ3,图 4;阅读者分析)

模型家族。按家族内模型的标签分布标准差,作者称 Phi 最多样、Llama 最少样;Mistral 更 stylized、较少 coherent 和 closed。这里的“多样”是少量家族成员之间的分布变异,GPT 甚至只有一个模型,不是单个模型在同一 prompt 下的角色覆盖率,也没有控制家族规模与采样量。(论文报告,RQ4,图 5;阅读者分析)

题材。Domestic 更 natural,Sci-Fi/Fantasy 更 stylized 和 symbolic,Romance 多为 coherent、whole、transparent;相似模式也出现在人类语料中。题材确实与标签共变,但不应把题材适配误写成模型本身的固定偏好。(论文报告,RQ5,图 6、附录 H.1)

重复采样。同一 prompt 对同一开源模型生成三次时,八维三次标签完全相同的 prompt 比例依次为 30%、22%、27.5%、13.5%、53.5%、45.5%、35.5%、3%。closure 和 literalness 尤其不稳定,说明单次生成不足以代表一个模型的固定角色风格;这个数字衡量采样一致性,不是分类准确率。(论文报告,RQ6,附录 H.2,图 10)

哪些混杂会改变解释

文本长度。人类 r/shortstories 平均 1,502.57 tokens;模型均值从 Mistral-7B 的 560.83 到 Llama-70B 的 1,027.53。更长文本有更多空间呈现复杂动机、变化和开放伏笔,也有更多机会完成角色弧;论文没有做长度匹配或回归控制。(论文报告,附录 F,表 8;阅读者分析)

不平衡采样。每个人类 prompt 只有一篇人类故事,开源模型各有三篇、GPT 只有一篇;4,400 个模型文本还共享 200 个 prompt,并非 4,400 个独立主题。若统计把故事都当独立样本而不建模 prompt 聚类,会夸大有效样本量。(阅读者分析)

来源与检测。“人类故事”来自 Reddit,AI detector 不能保证完全排除机器辅助;自动域分类器在两个 subreddit 间只有 24.52 macro-F1,只能说明该分类提示表现很差,不能严格证明两个来源同分布。平台可公开访问也不等于作者对再分发和模型分析有明确知情同意。(论文报告,Limitations、附录 E;阅读者分析)

适用范围。论文只覆盖英文、prompt 驱动短篇和主角,不代表长篇小说、编辑出版文本、多语言写作或配角群像。八个维度来自特定叙事理论,移植到中文、网文或非虚构文本前需要重新标注和校准。(论文报告,§7、Limitations;阅读者分析)

原文定位(附录)

读完后的判断

CASPER 的价值不在于给角色质量算一个总分,而在于把“角色扁平”拆成八个可以逐项讨论的呈现问题。对写作系统,它最适合作为诊断面板:检查主角是否总被写成类型化人物、是否每次都成长、是否所有人物弧都封闭、是否用象征替代了具体的人。八维不能直接相加,目标分布还应随题材和作者意图改变。

对论文的人机比较则应保持中等偏低信心。框架有理论来源,语料构建也努力控制题材,但量尺仍不够稳定,PDF 对最终模板的说明互相矛盾,文本长度和聚类结构没有控制。下一步最关键的不是再扩几万篇自动标签,而是做长度与 prompt 匹配的分层抽样、对核心差异进行盲法人工复核、报告 cluster-aware 置信区间,并检验八维是否真的预测读者感受或作品质量。