![]()
你有没有试过让ChatGPT帮你写一段说唱歌词?
结果大概率是这样的:押韵对是对上了,但读起来像一篇分行的作文,没有flow,没有节奏感,甚至你都不知道该怎么念出来才带感。再试试让它写一份电影剧本,你会发现对话是有了,但根本不符合剧本格式,没有场景标注,没有镜头语言,更别提让它写游戏设计文档了,机制、玩法、玩家交互这些术语,它压根不知道该往哪儿摆。
这不是模型笨,而是它压根没怎么学过这些东西。
一群来自韩国中央大学和LG AI研究院的研究者发现了这个问题的根源:现在市面上能拿来训练AI写作能力的高质量数据,几乎全部是故事,而且是那种起承转合的小说体故事。你去看那些经典的写作数据集,WritingPrompts也好、ROCStories也好,清一色是叙事文本。这就好比一个厨师从小到大只学过做红烧肉,你让他去做分子料理,他连工具都不认识。
数据的偏科到底有多严重
先说一个可能颠覆你认知的事实:大语言模型最常被使用的场景之一就是创意写作,这不是小众需求,而是实打实的高频刚需。但支撑这些模型学会创意写作的训练数据,却严重偏科在"讲故事"这一件事上。
这事儿听起来好像没什么大不了,写故事不也是创意写作吗?问题是,现实里人们找AI写东西的需求五花八门。有人要写说唱歌词,有人要写一份手游的角色设定,有人要写播客脚本,有人要写话剧对白。这些体裁彼此之间的差别,根本不是换个话题那么简单,而是结构和功能上的天壤之别。
说唱要求押韵密度、节奏感和flow,电影剧本要求场景转换、人物弧光和台词分寸,游戏设计文档要求讲清楚游戏机制和玩家如何互动。这些都是硬性的、可以被专业人士一眼识别出"对不对"的行业规范。
一个只在故事堆里泡大的模型,可能叙事能力很强,词藻华丽,情节流畅,但你让它写个说唱verse,它给你的可能是押韵的散文,完全没有节奏感可言。
研究者把这个问题概括得很精准:模型学会了丰富的叙事内容,却学不会不同创意体裁各自的结构性和功能性规范。
**这才是问题的核心,不是AI不会写,而是AI只学过一种"写法"。**
为什么不能简单粗暴地"造数据"
那办法很简单啊,缺什么类型的数据,就去造点什么类型的数据不就行了?
没那么容易。
现在业界已经有一套成熟的思路去批量生成训练数据,叫做合成指令生成,简单说就是拿几个种子任务,然后让AI自己去演化、扩写出更多类似的指令和答案,数量可以滚雪球一样越滚越大。这套方法在编程和数学领域已经玩得很转了,因为这两个领域有一个天然的优势:答案对不对,是可以被验证的。代码跑不跑得通,一试便知,数学题算得对不对,也是板上钉钉的事。
创意写作恰恰缺这种验证的锚点。
一首说唱写得好不好,一部剧本写得地道不地道,没有一个可执行的程序能给你打分。你要是照搬编程数学那套"自动生成加自动验证"的流程,大概率会得到一堆话题挺新鲜、但格式完全跑偏的东西。因为写作这件事的"对不对",取决于人类长期形成的、约定俗成的体裁惯例,比如歌词该怎么分段、剧本该怎么标注场景,这些东西不是靠算法能凭空推导出来的,它得靠人的经验去定义。
**这意味着,创意写作数据的生成,需要人类介入的不只是最后把关质量,更是从一开始就要定义每个体裁"该长什么样"的游戏规则。**
打个比方,这就像你要教一个从没见过中餐的外国厨师做菜。你不能只告诉他"做出好吃的菜就行",然后指望他自己悟出川菜要麻辣、粤菜要清淡、鲁菜要咸鲜。你得先把每个菜系的调味逻辑、烹饪手法先讲清楚,他才有可能做出像样的东西来。如果跳过这一步,直接让他"随便发挥",结果大概率是所有菜吃起来都差不多,因为他根本不知道菜系之间的边界在哪儿。
拆开"聊什么"和"怎么写"
研究团队想出的解法,叫做属性引导的体裁扩展框架。
这个名字听着拗口,拆开看其实思路很直白:把"写什么内容"和"用什么体裁写"这两件事彻底分开处理。
以前的数据往往是内容和体裁绑死的,一个种子提示词天生就是故事,你没法把它直接改造成一份游戏设计文档。这个团队的做法是,把"主题创意"当作可以自由搬运的原材料,把"体裁规范"当作单独的调味料,想给什么话题配什么体裁,现炒现卖。
具体怎么做?
他们先从Reddit上一个叫r/WritingPrompts的社区论坛里,收集了大量人类真实写的故事创作提示。
引用块:r/WritingPrompts,是Reddit上一个专门发布创意写作提示的社区,用户在这里贴出各种故事开头或设定,供其他人续写。这些帖子由真人撰写,题材五花八门,从爱情、战争到科幻、悬疑都有,天然带有丰富的话题多样性。
这些故事提示本身质量参差不齐,团队先用GPT-5-mini过滤了一遍,删掉了686条包含不当内容的样本,又清理了861条跑题或者带论坛套话的碎片内容。剩下的,就是一批干净、话题丰富的种子库。
接下来是关键的一步:给每个目标体裁,人工整理出一套专属的"结构属性清单"。
比如说唱这个体裁,清单里会列出押韵方案、flow节奏、双关语、主题、速度、押韵密度、金句、韵律、比喻、俚语使用这些维度。电视剧剧本会有另一套清单,叙事弧线、人物成长这些。这些清单不是AI瞎编的,而是团队先让GPT-5从维基百科和创作手册里提取出结构化的属性列表,再由人工逐条审核、合并重复项、剔除太笼统的说法、补充遗漏的关键维度,最终每个体裁沉淀出5到15条属性。
有了话题种子和体裁属性这两样东西,生成的时候,团队会随机抽5个故事提示当作"话题灵感来源",再从对应体裁的属性清单里随机抽取一部分属性(数量也是随机的,从0个到全部都有可能),把这两者塞进一个统一的提示模板里,喂给GPT-5-mini去生成新的写作指令。
**这里有个很巧妙的设计:抽取的属性数量是随机的。**
抽0个属性的时候,生成的指令就是完全开放式的,类似"写一段关于城市孤独的说唱"。随着抽取的属性越来越多,指令会变得越来越具体,比如"写一段关于城市孤独的说唱,要求AABB押韵,节奏感强,大量使用双关"。这么做是为了模拟真实世界里人们提问的多样性,有人问得笼统,有人问得极其精细,数据集也得覆盖这两头。
引用块:verbalized sampling(显式采样),是一种在生成阶段明确要求模型输出内容在话题、语气、结构上要有差异的技巧,用来防止生成的多条内容彼此高度雷同,也就是常说的模型崩塌问题。
生成完指令之后,团队用Qwen3-235B-A22B-Thinking这个强模型去回答这些指令,产出对应的作品。最后再用另一个独立的模型Qwen3-30B-A3B-Instruct当裁判,给每条回答打分,把得分低于平均分两个标准差的低质量样本筛掉。
这一整套流程走下来,最终形成了一个叫Multi-Genre Collection的数据集,总共5万条样本,横跨13个创意体裁,包括故事、歌词、说唱、电影剧本、游戏设计、播客脚本、话剧对白、电视剧本、演讲稿、杂志文章、角色设计等等,还有一小部分归入"其他"类别的长尾体裁,比如日记体、漫画剧本、互动小说这些。
这套设计如果不这样做会怎样?
如果直接让AI凭空生成各种体裁的写作指令,不给任何属性约束,大概率会出现"话题挺新鲜,但格式全靠模型自由发挥"的情况。你问它写游戏设计文档,它可能只是换了个话题的故事,压根不会出现"核心玩法""胜负条件""关卡设计"这些专业结构。属性清单的存在,相当于给AI划了一条硬性的护栏,逼着它在生成指令的时候,必须往这些结构性维度上靠。
数据长什么样,靠不靠谱
数据造出来了,得验证一下这套东西是不是真的做到了"体裁各自独立、彼此有区分度"。
团队做了个可视化实验,把所有生成的指令用一个叫Qwen3-Embedding-0.6B的模型转换成向量,再用t-SNE降维技术投影到二维平面上观察分布。
引用块:t-SNE,是一种把高维数据压缩到二维或三维空间进行可视化的算法,常用来直观检验数据点之间是不是真的存在分组和聚类关系。
结果显示13个体裁在图上形成了边界清晰、几乎没有重叠的独立聚类。这说明这套属性注入的方法,确实生成出了体裁上有实质区分的指令分布,而不是简单地把故事换了个说法重新包装了一遍。
从数量分布看,故事类占了13.6%,略高于其他体裁,剩下12个主要体裁each占6.8%左右,长尾的"其他"类占5.1%。整体上做到了相对均衡的覆盖。
训练出来的模型到底强不强
数据有了,接下来就是拿去训练模型,看效果。
团队选了三个基础模型来做实验:Llama-3.1-8B-Instruct、EXAONE-3.5-7.8B-Instruct、还有Qwen3-8B。都用LoRA做微调。
引用块:LoRA(低秩适应),是一种参数高效的微调技术,不需要更新模型全部参数,只训练一小部分低秩矩阵,既能省算力,又能保留模型原有的知识。
评测用了三套标准。一套是Arena Hard的创意写作子集,由GPT-4.1对照参考答案打分。一套是WritingBench里跟创意写作相关的领域,由GPT-5-mini打分。还有一套是从Multi-Genre Collection本身留出的测试集,13个体裁each留了50条,共650条,由GPT-4.1按1到10分打分,考察质量、创意性和体裁契合度。
结果挺打眼的。三个基础模型在用这套数据微调之后,全部实现了明显提升。拿Llama来说,微调前在Arena Hard上只有2.9分,微调后飙到33.0分,涨了整整30.1个百分点。这不是一星半点的进步,而是几乎重新定义了模型的写作能力。
**更值得说道的是,这些微调后的模型,全部超过了专门为长文写作优化的LongWriter-glm4-9B基线模型。**
LongWriter原本在Arena Hard上只有2.3分,远低于所有微调后的模型。这说明一个专攻"写得长"的模型,不如一个学过"写得对体裁"的模型好使。堆量不如把结构学明白,这个道理放在这里格外贴切。
团队还找来了另一个现成的写作数据集DeepWriting做对比。为了公平起见,双方都只抽2000条样本来训练同一个Qwen3-8B模型。结果Multi-Genre Collection训出来的模型,在Arena Hard上拿到7.5分,比DeepWriting训出的4.9分高出不少,在体裁覆盖测试上也是71.4分对65.9分,全面胜出。
| 数据来源 | Arena Hard | WritingBench | 多体裁覆盖测试 |
| DeepWriting | 4.9 | 55.5 | 65.9 |
| LongWriter | 7.0 | 56.4 | 69.6 |
| **Multi-Genre** | **7.5** | **59.1** | **71.4** |
体裁越多,输出越有新意
这里有个特别耐人寻味的发现:随着训练时用到的体裁数量增加,模型输出内容的新颖度也在持续攀升。
团队用了一个叫NoveltyBench Distinct的指标来衡量这一点,它的原理是把生成的多条内容按语义和功能相似度聚类,聚类数越多,说明生成的内容彼此差异越大,新颖度越高。
引用块:NoveltyBench Distinct指标,通过将模型的多次生成结果按内容是否语义等价进行分组,统计出不重复的簇的数量,来量化模型输出的多样性和非重复性。
实验设置了不同的体裁数量梯度:只用0个体裁(相当于没训练)、4个、8个、12个、全部13个体裁。新颖度分数分别是3.87、3.93、4.26、4.56、4.81,一路单调上升。
| 训练体裁数量 | 0 | 4 | 8 | 12 | 全部13个 |
| 新颖度得分 | 3.87 | 3.93 | 4.26 | 4.56 | **4.81** |
这个现象说明的东西,比表面看起来更深一层。不只是"体裁多了模型见识广了"这么简单的解释,而是暗示着体裁之间的结构差异,能够反过来激活模型在创作时的表达空间。一个只见过故事的模型,写什么都往叙事的套路里靠,而一个见过说唱的节奏感、见过剧本的场景切换、见过游戏文档的机制描述的模型,它脑子里可用的"表达模板"变多了,自然更不容易写出千篇一律的东西。
这就像你去问一个只吃过白米饭的人和一个吃过八大菜系的人,同样是"给我做顿饭"这个要求,后者能给出的答案空间显然大得多。见得越多,组合的可能性越丰富,这不是玄学,是实打实能测出来的效果。
排除"自己夸自己"的嫌疑
一个很自然的疑问冒出来了:整套流程里,生成指令和最初评判质量都用了GPT系列模型,那最后测评模型能力的时候,会不会存在"自己人评自己人"的偏袒?
团队专门做了个交叉验证,换了三个完全独立的裁判模型:GPT-5-mini、DeepSeek v3.2、Gemini 3 Flash,分别对微调前后的Llama和Qwen模型打分。
结果显示,不管换哪个裁判,微调后的模型都稳定超过微调前的版本。比如Qwen在GPT-5-mini裁判下从56.1分涨到63.6分,在DeepSeek v3.2裁判下从51.5涨到65.9,在Gemini 3 Flash裁判下从58.5涨到71.5。三套完全不同的裁判系统,得出的结论高度一致。
| 裁判模型 | GPT-5-mini | DeepSeek v3.2 | Gemini 3 Flash |
| Llama基础版 | 43.7 | 36.6 | 41.7 |
| Llama微调后 | 60.6 | 63.1 | 70.5 |
| Qwen基础版 | 56.1 | 51.5 | 58.5 |
| Qwen微调后 | **63.6** | **65.9** | **71.5** |
不放心的话,团队还找了真人来评分,从WritingBench里随机抽了50道题,让人类按照标准打分。结果Multi-Genre Collection训出的模型得分59.3,略高于LongWriter的57.7和DeepWriting的56.9。虽然差距不算悬殊,但方向和之前的机器评测是一致的。
一个具体案例:写歌词的差距在哪
抽象的分数聊了这么多,不如看一个具体例子更有画面感。
论文里给了一个测试案例,要求写一首带故事情节的交响金属死核风格歌词,主题是"一个逐渐被力量腐蚀的年轻巫师",格式还要适配Suno这类AI音乐生成工具。
基础版Llama写出来的东西,遵循了传统的verse-chorus结构,但意象比较套路化,比如"凤凰涅槃""知识越多黑暗越深"这类,读起来像是随便哪首西方摇滚都能套用的歌词模板,而且没有标题,也没有具体的人名或地名。
微调后的Llama交出的答案叫ASCENDANCE,一上来就有标题。故事发生在一个叫Aethel的具体地方,有个反复出现的角色叫Elara,还提到了三个具体的魔法名字,Lumen、Aero、Verdant,而且每一段都标注了精确到秒的时间戳,完全符合Suno这类工具的输入格式要求。
**这个对比说明的不只是分数上的提升,而是模型学会了体裁的"里子",不只是押韵和节奏,还包括世界观搭建的细节感、格式规范的死记硬背、以及叙事的连贯逻辑。**
这就好比让两个人写一份产品需求文档,一个人只是把想法写成大白话段落,另一个人知道这类文档必须有版本号、必须有验收标准、必须标注优先级。哪怕两人表达的核心想法差不多,后者写出来的东西一看就是"内行",前者写出来的东西一看就知道没在这行干过。格式和结构上的这些"暗规则",恰恰是这篇论文想要教给AI的东西。
这条路往前会走向哪里
创意写作数据集这条线,早年的代表作品都聚焦在单一体裁上。WritingPrompts主打故事提示配对,ROCStories专攻五句话的常识性短故事,用来训练模型理解叙事逻辑,LitBench则是给故事质量和写作风格建立了偏好标注体系,用来评判什么样的故事写得更好。
除了故事之外,也有零星工作瞄准过单个非故事体裁。SongComposer专门研究歌词和旋律的配对生成,Mirowski等人的工作专注在剧本和话剧的人机协同创作上,请了业内专业人士来评估AI的协作能力。
这些工作各自在自己的赛道上钻得挺深,但没有一个尝试把13种体裁放进同一个框架里统一处理。**这篇论文补上的,恰恰是这个长期被忽视的整合性空白。**
至于这条思路会怎么继续往前走,有几个值得琢磨的方向。一个是体裁的数量能不能继续扩,现在13个覆盖的还只是常见需求,真实世界里的创意写作场景恐怕比这多得多,比如广告文案的不同细分类型,或者不同文化背景下的说唱风格差异。另一个是属性清单本身要不要引入更动态的更新机制,毕竟创意体裁的规范也在随着时代变化,今天的短视频脚本规范和五年前完全不是一回事。
写在后面
读完这篇论文,最触动我的一点是,它把一个看似"内容生成"的问题,重新定义成了"结构规范"的问题。
我们平时聊AI写作,总习惯性地关注它"写得好不好看",很少去想它是不是"写得对不对格式"。这篇论文提醒我,创意写作的门槛,很多时候不在于想象力,而在于对体裁潜规则的熟悉程度。一个人类新手编剧写不好剧本,往往不是想象力不够,而是不懂场景转场该怎么标,这跟AI遇到的问题其实是一回事。
另一个让我意外的细节是,属性抽取数量用了随机采样,从0到全部随机取一个数值。这个设计初看不起眼,但它解决的其实是"指令颗粒度"的问题,现实中人们提需求,有的极其模糊,有的极其精确,一个好的训练数据集得同时覆盖这两种情况,而不是假设用户永远会说清楚自己想要什么。
如果这套思路继续往下推,下一个值得追问的问题是:体裁之间的属性清单,能不能也交给模型自己去归纳和更新,而不是完全依赖人工整理?毕竟人类创作形式还在不断演化,谁能保证十年后不会冒出一种全新的、现在还没被命名的创作体裁?
Q&A
Q1:Multi-Genre Collection数据集是什么?
A:这是一个由韩国研究团队构建的5万条样本的创意写作数据集,覆盖故事、说唱、歌词、电影剧本、游戏设计文档等13种创意体裁,专门用来解决AI模型在非故事类创意写作上表现薄弱的问题。
Q2:属性引导的体裁扩展框架具体是怎么做的?
A:它把"写什么话题"和"用什么体裁写"分开处理,从Reddit的r/WritingPrompts社区获取真实的故事创作主题作为话题种子,再结合人工整理的各体裁结构属性清单(比如说唱的押韵方案、flow节奏),组合生成既有话题多样性又符合体裁规范的写作指令。
Q3:用这套数据训练出来的模型效果到底好在哪?
A:实验显示,用这套数据微调的模型不仅全面超过原始基础模型,还超过了专门做长文写作优化的LongWriter基线模型和其他现有写作数据集训练出的模型,而且训练时接触的体裁种类越多,模型生成内容的新颖度也越高,这一结论在多个独立裁判模型和人工评测下都得到验证。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.