最近有一条研究新闻在内容创作者圈子里讨论得不少,标题很直接:AI-generated stories rated better quality than human-written ones, study finds。大意是 AI 写出来的故事,在质量评价里拿到了比人类作者更高的分数。我第一反应不是“人类写作要被替代了”,而是这个评价到底在衡量什么。
做内容、做工程的人都清楚,一个评测指标的提升,不等于一个系统放在真实产品里就一定能成功。模型在测试集上得分高,不代表它在生产环境里不会出问题;AI 写出来的故事读起来顺,也不代表它能完成选题判断、事实核查、风格统筹和价值观把关。但我也注意到,很多人已经开始把 AI 直接当写手来用,还有人开始焦虑自己的写作训练还有没有必要。这篇文章不打算争论“AI 是不是真的比人强”这个结论本身,而是想讨论另一件更实际的事:当一个 AI 生成内容的研究结论开始被广泛传播时,内容创作者该怎么理解它,怎么把它落进真实工作流,又怎么避免被评测口径带偏。
1. 先别急着说“AI 已经赢过人类”,评测得看标准和场景
1.1 评测分数高,通常意味着什么
这类研究的常见做法,是让人工评估者阅读 AI 生成的故事和人类写的故事,然后打分。结果大家看到的是:AI 的均分更高。但如果只看这个结果,很容易忽略一个关键问题:评估者在打分时,到底更喜欢什么?
从工程经验看,AI 生成文本在测试里拿高分的优势一般集中在几个方面。
一是流畅度高。模型经过大规模训练,对“通顺”这件事有很强的把握,输出句子通常没有语法硬伤,也不会出现写到一半忘掉主线的情况。二是结构完整。早教一个“故事”时,模型会按比较稳定的叙事结构展开,开头、冲突、结尾都在。三是速度快,可以在短时间内给出多个版本。
这些特点一旦放到“打分量表”里,优势会非常明显。评审者面对大量文本时,往往更容易被读起来顺、结构完整的作品吸引。
但分数高不等于“写得更好”。写作的价值远不止“句子通顺”和“结构完整”。人类作者在故事里放进去的个人经验、现实观察、情感克制和留白,在量化评分中不一定加分,但在读者那里可能是最关键的东西。
我们得先承认一个事实:很多评测框架衡量的是“完成度”,不是“原创性”,更不是“文学价值”。所以 AI 在评测中胜出,更像是在“把一个规定动作做标准”这件事上胜出,而不是在“创造一种新的表达方式”这件事上胜出。
1.2 为什么“会写故事”不等于“能承担写作工作”
如果把“写作”看成一个完整工作流,它至少包括以下环节:
- 理解用户需求和内容定位;
- 确定选题和故事角度;
- 组织信息,做必要的事实核查;
- 起草、改写、压缩、扩写;
- 统一风格、语气和调性;
- 评估风险,规避不适内容;
- 发布后根据反馈继续迭代。
AI 目前最能替代的是“起草”环节,也就是把已有的主题、上下文和素材快速组织成初稿。这确实是一个很大的效率提升,但如果你把它理解为“AI 可以承担整个写作工作”,后面一定会出问题。
举个例子。一个产品团队想写一篇品牌故事,AI 可以快速生成一个结构完整、语言优美的版本。但品牌故事里涉及公司历史、数据口径、合规表述,这些都需要人去确认。AI 生成的内容可能把一件未经核实的事写得很像真的,也可能把一个需要谨慎表述的细节说得太绝对。这时候如果没有人工审核环节,直接发布,风险就不是“故事不够好”,而是事实错误和责任问题。
所以我的判断是:这类研究标题的真正价值,不是证明“AI 已经替代人类作者”,而是把“写作”这个模糊的能力概念拆开了。AI 先拿下了“生成文本”这个子问题,留下的仍然是整条决策链里更复杂的部分。
2. 把 AI 生成故事变成可复用流程:一个最小工作流
2.1 最小可用流程:从任务拆解到发布
不想被研究结论带偏,也不想错过 AI 带来的效率提升,最务实的做法是先搭一条最小的生产流程。先跑通,再优化。这个原则在内容生成里同样成立。
我一般会建议从下面六步开始:
- 拆任务:明确你要写的是故事、文章、脚本还是营销文案;目标读者是谁;发布平台是什么。
- 填上下文:给 AI 提供足够的信息,包括主题、长度、风格、关键事实、结构要求和需要规避的点。
- 先出提纲:不要一上来就要求“给我一篇完整故事”,先让 AI 产出大纲、人物卡、情节节点。
- 分段生成:根据提纲逐段生成,而不是一次生成全文。分段生成更容易控制主题走向。
- 人工编辑:做事实核查、风格调整、删减冗余、补齐真实感受。
- 发布并收集反馈:打开率、完读率、收藏、评论,这些数据最终指导下一轮生成。
这六步看起来很多,但在实际运行中,真正花时间的是第一步和第五步。AI 负责中间过程的“快速生成”,人负责两端的“判断”和“修正”。
2.2 为什么“先写提纲、再写全文”更稳
很多第一次接触 AI 写作工具的人,最常犯的错是直接输入“帮我写一个关于创业者的故事”,然后期待模型输出一篇完整作品。这样做不是不行,只是结果质量很不稳定。模型可能会生成一篇结构完整但内容平淡的故事,也可能在中间某一段开始跑偏,后面又没能拉回来。
先写提纲,本质上是在工程里先定义接口,再写实现。你不需要在一开始就告诉 AI 每一段的具体内容,但你需要让它知道故事从哪里开始、中间有哪些转折、最后落在哪里。
比如你可以这样输入:
请帮我设计一个 1500 字左右的短故事,主题是“独立开发者开发第一个产品的经历”。 要求: 1. 开头从一个具体场景切入,不要用抽象描述; 2. 中间至少有一个转折,比如用户反馈与预期完全不同; 3. 结尾落到“重新理解需求”这个结论,不要写成成功学鸡汤; 4. 风格克制,不要过度抒情; 5. 先给我 200 字的故事大纲,确认后再展开全文。这样做的好处是,AI 在生成全文前,已经对结构和核心信息有了共识。如果大纲有问题,直接改大纲,比生成全文后再反复重写便宜得多。
2.3 关键参数与前置条件
如果你用的是 API 或本地部署模型,还要关注几个基础参数。
温度(Temperature)控制随机性。写故事类内容,温度可以稍高,但要避免太高导致逻辑断裂。一般常见做法是从 0.7 开始调整,写公文或说明文可以降到 0.3 到 0.5 左右。
上下文长度(Context Window)决定模型一次能“看到”多少内容。输入长故事的大纲、人物关系和前文时,要注意不能超过模型支持的最大长度。超长输入通常会被截断,输出的连贯性就会下降。
输出限制(Max Tokens)决定一次生成的最大长度。如果目标是一篇 3000 字文章,最好分段生成,而不是让模型一次性输出完,否则后半段容易出现内容稀释和质量下降。
如果你是在本地部署模型,还要考虑显存和内存。小规模生成实验用 CPU 也能跑,但速度会慢很多。做批量实验前,先确认自己的硬件和模型适配情况。
这个阶段不需要追求参数最优,先把流程跑通。等输入输出都稳定了,再针对具体问题调节参数。
3. 评质量不能只看“读起来顺”,要有一套评估框架
3.1 四个评估维度:结构、信息密度、语言、情感真实度
用 AI 生成内容,最怕的就是读第一遍觉得“还行”,但发出去之后读者反馈很平。要避免这个问题,需要一套比“读起来顺”更严格的质量评估框架。我常用四个维度。
| 维度 | 评估重点 | 常见问题 | 人工重点 |
|---|---|---|---|
| 结构 | 主线是否清晰,段落衔接是否自然,开头是否能吸引人 | 结构完整但节奏平、缺少变化 | 检查开头和结尾是否有冲击力,中间是否存在可删段落 |
| 信息密度 | 是否有具体细节,是否有实例,是否有信息增量 | 空话多、内容注水、泛泛而谈 | 把形容词多的句子改为有具体场景或数据支持的句子 |
| 语言质量 | 是否有语法错误,用词是否准确,风格是否统一 | 语句通顺但过于整齐,缺少个人语感 | 调整过于“模型腔”的表达,让语气更自然 |
| 情感真实度 | 是否能让人相信作者有真实感受或经验 | 情节流畅但缺乏可信度,像“安全但平庸”的作文 | 补充真实经历、具体观察、情绪克制后的细节 |
这四个维度看起来简单,但放在一起能构成一个很实用的判断框架。AI 文本在“结构”和“语言”上通常能拿不错的分数,在“信息密度”和“情感真实度”上则很容易露馅。如果你生成的内容要发布在专业平台,后两个维度往往更重要。
3.2 人工审核应该承担什么
有了评估维度,还要明确人工审核的职责边界。AI 可以帮你写初稿,但有些问题它处理不了。
第一,事实核查。AI 生成的内容可能包含准确信息,也可能包含完全虚构的事实。凡是涉及数据、历史、政策、产品功能、公司信息等内容,都要逐条核对。
第二,风险判断。内容是否适合发布,受众看到之后会不会产生误解,是否存在合规风险,这些问题需要人来判断。
第三,风格一致性。一个账号、一个团队、一个品牌往往有相对稳定的语气。AI 可以模仿某个风格,但它不知道你的读者已经习惯怎样的表达方式。这个判断只能由熟悉业务和读者的人来做。
第四,价值观把关。故事里涉及人物、冲突、结局方式,都暗含立场和价值观。AI 生成的“正确但平庸”的价值观表达,不一定适合你的内容立场。
3.3 把评估表放进日常工作流
评估表不是写给别人看的,而是要用在每次生成之后。你可以按下面这个顺序操作:
- 生成初稿后,先按四个维度打分;
- 对低于 3 分的维度,明确问题是什么;
- 带着问题回到 AI,做针对性修改,而不是整篇重来;
- 人工修改完成后,再做一次“读者视角”阅读;
- 发布后记录反馈数据,反向修正下一轮的输入模板。
这样做一段时间后,你会慢慢发现哪些提示词模板能稳定产出高质量初稿,哪些场景最好还是自己写。这个过程本身就是一次“用工程思维做内容”的实践。
4. 真正容易翻车的地方:输入、参数、输出和边界
4.1 输入:上下文不足,AI 就会“自由发挥”
AI 写作翻车的第一原因,通常不是模型不够强,而是输入太少、太模糊。你只给一句话“写一篇关于加班的文章”,模型就只能靠训练数据里的平均印象去猜,结果自然平庸。
要避免这个问题,需要在输入侧多花一点时间。除了主题,还要补充:发布平台、目标读者、字数、风格、必须包含的要点、不要出现的表达方式。
这样做的原理是:AI 生成内容是概率预测,上下文越充分,预测空间越小,输出越可控。上下文不足,它就会在无数可能方向里随机“自由发挥”。
4.2 环境和参数:批量、并发、token 与缓存
如果你不只是写一篇,而是要做批量内容生成,还会遇到几个工程问题。
批量任务不能一上来就拉满并发。有些 API 对调用频率有限制,一次性大量请求可能触发限流。更稳妥的做法是先跑一条样例,确认输入输出正常,再逐步增加任务数量。
对于较长的文本生成,还要注意 token 消耗。某些模型按 token 计费,输入越长、生成越长,成本越高。如果每个任务都要喂入大量上下文,成本会呈线性上升。
如果你开发了一个内容辅助工具,建议增加缓存和日志。相同或相似输入可以直接复用结果,减少重复调用。日志则用来记录每次生成的参数、结果和时间,方便后续优化。
4.3 输出物审核:事实、风格、合规与风险
AI 生成内容有一个很迷惑人的特点:它通常读起来很自信。不管信息对错,它都倾向于用肯定的语气呈现出来。所以发布前审核绝不是走形式。
审核时要重点看四类问题:
- 事实性信息是否准确;
- 是否包含可能误导读者的表述;
- 是否存在格式、版权、来源方面的问题;
- 是否符合平台规范和内容安全要求。
涉及具体产品或项目的技术类文章,尤其要注意版本号、功能名称、参数和注意事项的准确性。即使 AI 生成的内容看起来完整,也不能跳过人工确认。
4.4 排查链路:从现象到边界
遇到 AI 生成质量不稳定时,可以按下面的链路排查,而不是盲目换模型或调参数。
- 看现象:是整篇跑题,还是局部逻辑断裂?是语言太平,还是事实有问题?
- 看输入:主题是否清楚?上下文是否充分?有没有自相矛盾的要求?
- 看参数:温度是否过高?输出长度是否被截断?批量任务是否触发限流?
- 看输出:是否在编写过程中偏离了提纲?是否存在需要实证的表述?
- 看流程边界:是不是一开始就不适合用 AI 生成这种内容?
这条链路能帮你把“AI 写得不好”这样的笼统问题,拆成“输入不足”“参数不当”“流程不匹配”等具体问题,然后逐一处理。
5. 长期价值:不是替代人,而是把内容生产变成可控流程
5.1 从“让 AI 写一篇文章”到“构建内容生产链路”
AI 写故事的研究结论能引发这么多讨论,一个重要原因是它碰到了人们对“创造性工作被替代”的焦虑。但从实践角度看,AI 提供的不是替代关系,而是一种新的流程能力。
以前一个人一天写一篇深度文章,已经算高效;现在如果你用 AI 辅助,可以在一天内完成选题方案、多版提纲、初稿和素材整理,然后把省下来的时间投入到采访、核实和表达润色上。这不等于文章质量自动变高,但你有了更多时间和精力去打磨真正重要的部分。
关键在于,你要把这件事从“让 AI 写一篇文章”升级为“构建一个内容生产链路”。这个链路包括输入模板、生成规则、质量评估、人工审核、发布反馈,以及基于反馈的迭代。AI 在其中承担生成阶段的高强度重复劳动,人承担控制和优化。
5.2 用反馈数据迭代
内容生产一旦流程化,就会产生数据。比如同一个主题不同开头对完读率的影响,AI 写的故事和人类写的故事在读者反馈上的差异,某个风格的文本在某个平台上的表现。
这些数据反过来能指导你优化提示词模板和评估标准。如果一篇 AI 辅助生成的故事获得了比过去更好的读者反馈,你可以分析它好在哪,然后把这个“好”固化到下一轮的输入模板里。
这有些像 A/B 测试:不要只依赖直觉判断哪篇内容好,而是看实际反馈。当然,具体场景里的内容质量很难用单一指标衡量,需要结合阅读量、评论、收藏、转化率等多方面数据来看。
5.3 适用边界:AI 适合什么,不适合什么
经过一段时间实践,你会逐渐形成判断:哪些内容交给 AI 辅助最有价值,哪些最好还是自己写。
比较适合的场景包括:结构化故事、产品文档初稿、头脑风暴、不同标题方案测试、内容改写和压缩、批量生成示例或小故事。
不太适合的场景包括:高度依赖个人经历和情感体验的内容、需要深度调查和一手采访的内容、需要专业判断或涉及合规风险的表达、风格非常强烈且依赖个人语感的创作。
这个边界不是固定不变的。随着模型能力提升和工具链完善,AI 能做好的范围会扩大。但对写作者来说,真正重要的不是退回“人 vs AI”的对立,而是搞清楚:哪些环节交给 AI 能提升效率,哪些环节必须由人来保证质量和责任。
结尾:与其争论谁更强,不如先建立自己的工作流
回到开头那条研究标题。AI 生成的故事在评测中拿到比人类作者更高的分数,这件事真正提醒我们的,不是“写作要完蛋了”,而是“写作工作的定义正在改变”。
评测分数高的部分,AI 确实可以承担;评测体现不了的部分,仍然需要人类判断。你在内容生产链里扮演的角色,会从一个“从零开始写作的人”,慢慢变成一个“定义输出标准、设计输入模板、审核输出质量、利用反馈持续优化的人”。这个转变不一定容易,但它是这个阶段更实际的方向。
如果一定要从这篇文章里带走一句话,我会说:先别焦虑 AI 会不会替代你,尽快搭一个最小内容生产流程,用一次真实任务验证 AI 在哪个环节能帮到你,哪个环节仍然离不开你。然后,再把那部分能交给 AI 的重复劳动,真正放手交出去。