尧图精选

当AI只会写故事,你让它写一份游戏设计文档试试

🕒 发布时间:2026/9/1 11:13:58 📁 来源:尧图网络
你有没有试过让ChatGPT帮你写一段说唱歌词结果大概率是这样的押韵对是对上了但读起来像一篇分行的作文,没有flow没有节奏感甚至你都不知道该怎么念出来才带感。再试试让它写一份电影剧本你会发现对话是有了但根本不符合剧本格式没有场景标注,没有镜头语言更别提让它写游戏设计文档了机制、玩法、玩家交互这些术语,它压根不知道该往哪儿摆。这不是模型笨而是它压根没怎么学过这些东西。一群来自韩国中央大学和LG AI研究院的研究者发现了这个问题的根源:现在市面上能拿来训练AI写作能力的高质量数据,几乎全部是故事,而且是那种起承转合的小说体故事。你去看那些经典的写作数据集WritingPrompts也好、ROCStories也好,清一色是叙事文本。这就好比一个厨师从小到大只学过做红烧肉你让他去做分子料理,他连工具都不认识。数据的偏科到底有多严重先说一个可能颠覆你认知的事实:大语言模型最常被使用的场景之一就是创意写作这不是小众需求而是实打实的高频刚需。但支撑这些模型学会创意写作的训练数据,却严重偏科在讲故事这一件事上。这事儿听起来好像没什么大不了,写故事不也是创意写作吗问题是,现实里人们找AI写东西的需求五花八门。有人要写说唱歌词有人要写一份手游的角色设定有人要写播客脚本有人要写话剧对白。这些体裁彼此之间的差别根本不是换个话题那么简单而是结构和功能上的天壤之别。说唱要求押韵密度、节奏感和flow电影剧本要求场景转换、人物弧光和台词分寸,游戏设计文档要求讲清楚游戏机制和玩家如何互动。这些都是硬性的、可以被专业人士一眼识别出对不对的行业规范。一个只在故事堆里泡大的模型可能叙事能力很强词藻华丽情节流畅,但你让它写个说唱verse,它给你的可能是押韵的散文完全没有节奏感可言。研究者把这个问题概括得很精准:模型学会了丰富的叙事内容却学不会不同创意体裁各自的结构性和功能性规范。**这才是问题的核心,不是AI不会写而是AI只学过一种写法。**为什么不能简单粗暴地造数据那办法很简单啊缺什么类型的数据,就去造点什么类型的数据不就行了没那么容易。现在业界已经有一套成熟的思路去批量生成训练数据,叫做合成指令生成简单说就是拿几个种子任务然后让AI自己去演化、扩写出更多类似的指令和答案,数量可以滚雪球一样越滚越大。这套方法在编程和数学领域已经玩得很转了,因为这两个领域有一个天然的优势:答案对不对是可以被验证的。代码跑不跑得通,一试便知,数学题算得对不对也是板上钉钉的事。创意写作恰恰缺这种验证的锚点。一首说唱写得好不好一部剧本写得地道不地道没有一个可执行的程序能给你打分。你要是照搬编程数学那套自动生成加自动验证的流程,大概率会得到一堆话题挺新鲜、但格式完全跑偏的东西。因为写作这件事的对不对取决于人类长期形成的、约定俗成的体裁惯例比如歌词该怎么分段、剧本该怎么标注场景这些东西不是靠算法能凭空推导出来的,它得靠人的经验去定义。**这意味着创意写作数据的生成,需要人类介入的不只是最后把关质量,更是从一开始就要定义每个体裁该长什么样的游戏规则。**打个比方这就像你要教一个从没见过中餐的外国厨师做菜。你不能只告诉他做出好吃的菜就行然后指望他自己悟出川菜要麻辣、粤菜要清淡、鲁菜要咸鲜。你得先把每个菜系的调味逻辑、烹饪手法先讲清楚他才有可能做出像样的东西来。如果跳过这一步直接让他随便发挥结果大概率是所有菜吃起来都差不多,因为他根本不知道菜系之间的边界在哪儿。拆开聊什么和怎么写研究团队想出的解法,叫做属性引导的体裁扩展框架。这个名字听着拗口拆开看其实思路很直白:把写什么内容和用什么体裁写这两件事彻底分开处理。以前的数据往往是内容和体裁绑死的一个种子提示词天生就是故事,你没法把它直接改造成一份游戏设计文档。这个团队的做法是,把主题创意当作可以自由搬运的原材料,把体裁规范当作单独的调味料,想给什么话题配什么体裁,现炒现卖。具体怎么做他们先从Reddit上一个叫r/WritingPrompts的社区论坛里,收集了大量人类真实写的故事创作提示。引用块:r/WritingPrompts,是Reddit上一个专门发布创意写作提示的社区用户在这里贴出各种故事开头或设定,供其他人续写。这些帖子由真人撰写,题材五花八门,从爱情、战争到科幻、悬疑都有,天然带有丰富的话题多样性。这些故事提示本身质量参差不齐,团队先用GPT-5-mini过滤了一遍,删掉了686条包含不当内容的样本,又清理了861条跑题或者带论坛套话的碎片内容。剩下的,就是一批干净、话题丰富的种子库。接下来是关键的一步给每个目标体裁,人工整理出一套专属的结构属性清单。比如说唱这个体裁,清单里会列出押韵方案、flow节奏、双关语、主题、速度、押韵密度、金句、韵律、比喻、俚语使用这些维度。电视剧剧本会有另一套清单,叙事弧线、人物成长这些。这些清单不是AI瞎编的,而是团队先让GPT-5从维基百科和创作手册里提取出结构化的属性列表再由人工逐条审核、合并重复项、剔除太笼统的说法、补充遗漏的关键维度,最终每个体裁沉淀出5到15条属性。有了话题种子和体裁属性这两样东西,生成的时候,团队会随机抽5个故事提示当作话题灵感来源再从对应体裁的属性清单里随机抽取一部分属性(数量也是随机的,从0个到全部都有可能),把这两者塞进一个统一的提示模板里,喂给GPT-5-mini去生成新的写作指令。**这里有个很巧妙的设计:抽取的属性数量是随机的。**抽0个属性的时候生成的指令就是完全开放式的类似写一段关于城市孤独的说唱。随着抽取的属性越来越多,指令会变得越来越具体,比如写一段关于城市孤独的说唱,要求AABB押韵,节奏感强,大量使用双关。这么做是为了模拟真实世界里人们提问的多样性,有人问得笼统,有人问得极其精细,数据集也得覆盖这两头。引用块:verbalized sampling(显式采样),是一种在生成阶段明确要求模型输出内容在话题、语气、结构上要有差异的技巧,用来防止生成的多条内容彼此高度雷同也就是常说的模型崩塌问题。生成完指令之后,团队用Qwen3-235B-A22B-Thinking这个强模型去回答这些指令,产出对应的作品。最后再用另一个独立的模型Qwen3-30B-A3B-Instruct当裁判,给每条回答打分,把得分低于平均分两个标准差的低质量样本筛掉。这一整套流程走下来最终形成了一个叫Multi-Genre Collection的数据集,总共5万条样本,横跨13个创意体裁,包括故事、歌词、说唱、电影剧本、游戏设计、播客脚本、话剧对白、电视剧本、演讲稿、杂志文章、角色设计等等还有一小部分归入其他类别的长尾体裁比如日记体、漫画剧本、互动小说这些。这套设计如果不这样做会怎样如果直接让AI凭空生成各种体裁的写作指令,不给任何属性约束,大概率会出现话题挺新鲜,但格式全靠模型自由发挥的情况。你问它写游戏设计文档,它可能只是换了个话题的故事,压根不会出现核心玩法胜负条件关卡设计这些专业结构。属性清单的存在,相当于给AI划了一条硬性的护栏,逼着它在生成指令的时候,必须往这些结构性维度上靠。数据长什么样,靠不靠谱数据造出来了,得验证一下这套东西是不是真的做到了体裁各自独立、彼此有区分度。团队做了个可视化实验,把所有生成的指令用一个叫Qwen3-Embedding-0.6B的模型转换成向量,再用t-SNE降维技术投影到二维平面上观察分布。引用块:t-SNE,是一种把高维数据压缩到二维或三维空间进行可视化的算法,常用来直观检验数据点之间是不是真的存在分组和聚类关系。结果显示13个体裁在图上形成了边界清晰、几乎没有重叠的独立聚类。这说明这套属性注入的方法,确实生成出了体裁上有实质区分的指令分布,而不是简单地把故事换了个说法重新包装了一遍。从数量分布看故事类占了13.6%,略高于其他体裁,剩下12个主要体裁each占6.8%左右长尾的其他类占5.1%。整体上做到了相对均衡的覆盖。训练出来的模型到底强不强数据有了,接下来就是拿去训练模型看效果。团队选了三个基础模型来做实验:Llama-3.1-8B-Instruct、EXAONE-3.5-7.8B-Instruct、还有Qwen3-8B。都用LoRA做微调。引用块:LoRA(低秩适应),是一种参数高效的微调技术,不需要更新模型全部参数,只训练一小部分低秩矩阵,既能省算力,又能保留模型原有的知识。评测用了三套标准。一套是Arena Hard的创意写作子集,由GPT-4.1对照参考答案打分。一套是WritingBench里跟创意写作相关的领域,由GPT-5-mini打分。还有一套是从Multi-Genre Collection本身留出的测试集,13个体裁each留了50条,共650条,由GPT-4.1按1到10分打分,考察质量、创意性和体裁契合度。结果挺打眼的。三个基础模型在用这套数据微调之后,全部实现了明显提升。拿Llama来说,微调前在Arena Hard上只有2.9分微调后飙到33.0分,涨了整整30.1个百分点。这不是一星半点的进步,而是几乎重新定义了模型的写作能力。**更值得说道的是,这些微调后的模型,全部超过了专门为长文写作优化的LongWriter-glm4-9B基线模型。**LongWriter原本在Arena Hard上只有2.3分,远低于所有微调后的模型。这说明一个专攻写得长的模型,不如一个学过写得对体裁的模型好使。堆量不如把结构学明白,这个道理放在这里格外贴切。团队还找来了另一个现成的写作数据集DeepWriting做对比。为了公平起见,双方都只抽2000条样本来训练同一个Qwen3-8B模型。结果Multi-Genre Collection训出来的模型,在Arena Hard上拿到7.5分比DeepWriting训出的4.9分高出不少,在体裁覆盖测试上也是71.4分对65.9分,全面胜出。| 数据来源 | Arena Hard | WritingBench | 多体裁覆盖测试 ||---|---|---|---|| DeepWriting | 4.9 | 55.5 | 65.9 || LongWriter | 7.0 | 56.4 | 69.6 || **Multi-Genre** | **7.5** | **59.1** | **71.4** |体裁越多输出越有新意这里有个特别耐人寻味的发现:随着训练时用到的体裁数量增加模型输出内容的新颖度也在持续攀升。团队用了一个叫NoveltyBench Distinct的指标来衡量这一点,它的原理是把生成的多条内容按语义和功能相似度聚类聚类数越多,说明生成的内容彼此差异越大,新颖度越高。引用块:NoveltyBench Distinct指标,通过将模型的多次生成结果按内容是否语义等价进行分组,统计出不重复的簇的数量,来量化模型输出的多样性和非重复性。实验设置了不同的体裁数量梯度:只用0个体裁(相当于没训练)、4个、8个、12个、全部13个体裁。新颖度分数分别是3.87、3.93、4.26、4.56、4.81,一路单调上升。| 训练体裁数量 | 0 | 4 | 8 | 12 | 全部13个 ||---|---|---|---|---|---|| 新颖度得分 | 3.87 | 3.93 | 4.26 | 4.56 | **4.81** |这个现象说明的东西,比表面看起来更深一层。不只是体裁多了模型见识广了这么简单的解释,而是暗示着体裁之间的结构差异,能够反过来激活模型在创作时的表达空间。一个只见过故事的模型,写什么都往叙事的套路里靠,而一个见过说唱的节奏感、见过剧本的场景切换、见过游戏文档的机制描述的模型,它脑子里可用的表达模板变多了,自然更不容易写出千篇一律的东西。这就像你去问一个只吃过白米饭的人和一个吃过八大菜系的人,同样是给我做顿饭这个要求,后者能给出的答案空间显然大得多。见得越多,组合的可能性越丰富这不是玄学是实打实能测出来的效果。排除自己夸自己的嫌疑一个很自然的疑问冒出来了:整套流程里,生成指令和最初评判质量都用了GPT系列模型那最后测评模型能力的时候,会不会存在自己人评自己人的偏袒团队专门做了个交叉验证,换了三个完全独立的裁判模型:GPT-5-mini、DeepSeek v3.2、Gemini 3 Flash分别对微调前后的Llama和Qwen模型打分。结果显示,不管换哪个裁判,微调后的模型都稳定超过微调前的版本。比如Qwen在GPT-5-mini裁判下从56.1分涨到63.6分在DeepSeek v3.2裁判下从51.5涨到65.9在Gemini 3 Flash裁判下从58.5涨到71.5。三套完全不同的裁判系统,得出的结论高度一致。| 裁判模型 | GPT-5-mini | DeepSeek v3.2 | Gemini 3 Flash ||---|---|---|---|| Llama基础版 | 43.7 | 36.6 | 41.7 || Llama微调后 | 60.6 | 63.1 | 70.5 || Qwen基础版 | 56.1 | 51.5 | 58.5 || Qwen微调后 | **63.6** | **65.9** | **71.5** |不放心的话,团队还找了真人来评分,从WritingBench里随机抽了50道题,让人类按照标准打分。结果Multi-Genre Collection训出的模型得分59.3,略高于LongWriter的57.7和DeepWriting的56.9。虽然差距不算悬殊,但方向和之前的机器评测是一致的。一个具体案例:写歌词的差距在哪抽象的分数聊了这么多,不如看一个具体例子更有画面感。论文里给了一个测试案例,要求写一首带故事情节的交响金属死核风格歌词,主题是一个逐渐被力量腐蚀的年轻巫师,格式还要适配Suno这类AI音乐生成工具。基础版Llama写出来的东西,遵循了传统的verse-chorus结构,但意象比较套路化,比如凤凰涅槃知识越多黑暗越深这类,读起来像是随便哪首西方摇滚都能套用的歌词模板,而且没有标题,也没有具体的人名或地名。微调后的Llama交出的答案叫ASCENDANCE一上来就有标题。故事发生在一个叫Aethel的具体地方,有个反复出现的角色叫Elara,还提到了三个具体的魔法名字,Lumen、Aero、Verdant,而且每一段都标注了精确到秒的时间戳,完全符合Suno这类工具的输入格式要求。**这个对比说明的不只是分数上的提升,而是模型学会了体裁的里子,不只是押韵和节奏,还包括世界观搭建的细节感、格式规范的死记硬背、以及叙事的连贯逻辑。**这就好比让两个人写一份产品需求文档,一个人只是把想法写成大白话段落,另一个人知道这类文档必须有版本号、必须有验收标准、必须标注优先级。哪怕两人表达的核心想法差不多,后者写出来的东西一看就是内行前者写出来的东西一看就知道没在这行干过。格式和结构上的这些暗规则,恰恰是这篇论文想要教给AI的东西。这条路往前会走向哪里创意写作数据集这条线,早年的代表作品都聚焦在单一体裁上。WritingPrompts主打故事提示配对,ROCStories专攻五句话的常识性短故事用来训练模型理解叙事逻辑,LitBench则是给故事质量和写作风格建立了偏好标注体系,用来评判什么样的故事写得更好。除了故事之外,也有零星工作瞄准过单个非故事体裁。SongComposer专门研究歌词和旋律的配对生成Mirowski等人的工作专注在剧本和话剧的人机协同创作上,请了业内专业人士来评估AI的协作能力。这些工作各自在自己的赛道上钻得挺深,但没有一个尝试把13种体裁放进同一个框架里统一处理。**这篇论文补上的,恰恰是这个长期被忽视的整合性空白。**至于这条思路会怎么继续往前走,有几个值得琢磨的方向。一个是体裁的数量能不能继续扩,现在13个覆盖的还只是常见需求,真实世界里的创意写作场景恐怕比这多得多,比如广告文案的不同细分类型,或者不同文化背景下的说唱风格差异。另一个是属性清单本身要不要引入更动态的更新机制,毕竟创意体裁的规范也在随着时代变化,今天的短视频脚本规范和五年前完全不是一回事。写在后面读完这篇论文,最触动我的一点是,它把一个看似内容生成的问题,重新定义成了结构规范的问题。我们平时聊AI写作,总习惯性地关注它写得好不好看很少去想它是不是写得对不对格式。这篇论文提醒我,创意写作的门槛,很多时候不在于想象力,而在于对体裁潜规则的熟悉程度。一个人类新手编剧写不好剧本,往往不是想象力不够,而是不懂场景转场该怎么标,这跟AI遇到的问题其实是一回事。另一个让我意外的细节是,属性抽取数量用了随机采样,从0到全部随机取一个数值。这个设计初看不起眼,但它解决的其实是指令颗粒度的问题,现实中人们提需求,有的极其模糊,有的极其精确,一个好的训练数据集得同时覆盖这两种情况而不是假设用户永远会说清楚自己想要什么。如果这套思路继续往下推,下一个值得追问的问题是:体裁之间的属性清单,能不能也交给模型自己去归纳和更新,而不是完全依赖人工整理毕竟人类创作形式还在不断演化,谁能保证十年后不会冒出一种全新的、现在还没被命名的创作体裁QAQ1Multi-Genre Collection数据集是什么A这是一个由韩国研究团队构建的5万条样本的创意写作数据集,覆盖故事、说唱、歌词、电影剧本、游戏设计文档等13种创意体裁,专门用来解决AI模型在非故事类创意写作上表现薄弱的问题。Q2属性引导的体裁扩展框架具体是怎么做的A它把写什么话题和用什么体裁写分开处理,从Reddit的r/WritingPrompts社区获取真实的故事创作主题作为话题种子,再结合人工整理的各体裁结构属性清单(比如说唱的押韵方案、flow节奏),组合生成既有话题多样性又符合体裁规范的写作指令。Q3用这套数据训练出来的模型效果到底好在哪A实验显示,用这套数据微调的模型不仅全面超过原始基础模型,还超过了专门做长文写作优化的LongWriter基线模型和其他现有写作数据集训练出的模型,而且训练时接触的体裁种类越多,模型生成内容的新颖度也越高,这一结论在多个独立裁判模型和人工评测下都得到验证。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →