要点速览
- 检查分两层:能数出来的交给规则,要读懂的才交给模型和人。
- 一个总分会把「写得挺顺」和「编了个不存在的功能」压成同一个数字。
- 事实准确性单独设一条线,其它维度分再高也不能替它补分。
- 硬指标没过的稿子先定向重写一轮,仍然不过就转人工,别在同一处反复重生成。
AI 长文的发布前检查分两层:能数出来的交给规则,要读懂的才交给模型和人。事实准确性单独设一条线,其它维度分再高也不能替它补分。硬指标没过的稿子先定向重写一轮,仍然不过就转人工,别在同一处反复重生成。
一篇 AI 写的长文交到手里,人的第一反应通常是通读一遍,觉得「还行」,改两个措辞就发了。
通读时最容易注意到的是句子顺不顺,最不容易注意到的恰恰是两件要命的事:文章里提到的某个产品功能其实不存在;两千多字里有八百字在说正确的废话。前者会让读者上门问「你们这个功能在哪」,后者会让整篇文章在搜索结果里没有位置。
先决定哪些交给规则,哪些交给人
把待检的问题摊开看,它们分成两类。
一类能数出来。标题多少个字、正文有几个 H2、目标词全文出现几次、有没有外部引用,这些都有唯一答案,谁来数结果都一样,成本接近于零。
另一类必须读懂才知道。这句话是不是编的、结构对读者的问题有没有回答到位、语言像不像人写的,规则表达不了,只能交给会阅读的判断者,可以是模型,也可以是人。
把两类混在一起,让模型一次看完全文打个总分,两边的好处都丢了。
规则那边丢掉的是可复现和可解释。同一篇稿子送给模型两次,标题长度这项可能一次说合适一次说偏短;规则给出的则是「标题 18 个字,区间 20 到 60,短了 2 个字」,审稿人不用信任任何黑箱就能直接去改,改完还能立刻重跑。
模型那边丢掉的是注意力。让它同时管标题字数和事实真伪,等于把有限的判断力摊薄在九个它本来就不擅长的机械指标上。规则先筛干净,模型的输出预算才能全花在语义上。
第一层:9 项确定性检查
下面是我们实际在跑的九项,每项给「合格 / 不合格」加实测值,不打分。手工照着检一遍也可行,只是慢。
元信息三项
标题长度。 我们的口径是 20 到 60 个字符。它的代价发生在页面之外:Google 会在结果页里改写或截断过长的标题链接,分享卡片同理,超长标题会在最有信息量的地方被切掉。典型的不合格是模型把整句话当标题写,四十几个汉字里前二十个都在铺垫。
描述长度。 70 到 160 个字符。它和标题是一对,在结果页里回答「点进去有什么」。Google 说明摘要可能直接取自 meta description、也可能从正文另选一段,所以这段字要能独立成立。两种极端都常见:一句十几个字的空话,或者把首段原封不动复制进去,后半截根本显示不出来。
H2 结构。 至少 3 个二级标题。检的是文章有没有真的被分成几件事来讲。AI 写长文很容易滑成一大坨连续段落,每句都通,但读者没法跳读,也没法从目录判断这篇讲不讲他关心的那件事。少于三个 H2,通常说明压根没规划过结构。
篇幅与用词三项
正文长度。 中文 1200 到 2500 字,英文 700 到 1500 词。下限是因为八百字很难把一个有搜索量的问题讲完;上限是因为长度一旦失控,注水的比例几乎必然上升。不合格时别急着让模型「再扩写一点」,先确认是内容不够,还是选题撑不起这个长度。
关键词密度。 目标词全文出现 3 到 12 次。下限保证文章确实在讲这个题目,上限拦硬塞。低于下限往往是模型写着写着跑了题;超过上限读起来会有明显的机械感,同一个词在相邻两段里出现四五次。
套话密度。 这项最容易做错。我们用一张句式表抓「在这个…时代」「随着…的发展」「值得注意的是」「综上所述」这类空话,判定标准是两个上限:命中的句式类别不超过 2 类,总次数不超过 5 次。偶尔一句不算问题,成片出现才记一笔。
逐句挑刺的检查会被审稿人训练成噪声,看两次就再也不看了;通篇注水恰恰是密度问题,单看每句都挑不出毛病,连起来读才发现两千字里有一半没提供信息。所以这项在我们这里只记提醒、不拦截:文笔值得说一句,但不值得为它整篇打回。
引用与链接三项
图片 alt。 正文引用的每张图都要有 alt 文本。它属于极少数「漏了完全没有提示」的东西:页面照样渲染,读者照样看图,只有依赖读屏软件的人和抓图的爬虫会碰壁。这两头各有明确要求——WCAG 2.2 把非文本内容的等价文本列为 A 级要求,Google 图片也把 alt 当作理解图片内容的主要依据。缺失算硬失败,补一句描述比漏掉便宜太多。
外部引用。 至少 2 条。检的是文章的说法有没有来处。零引用的 AI 长文,所有断言只能追溯到模型自己,审稿人无从核对。还有一种更麻烦的不合格:引用了,但链接指向不存在的页面,所以这项最好连带跑一次可达性验证。
站内互链。 至少 1 条。它是九项里唯一的软性检查,只提醒不拦截,原因很实际:刚开始建内容站的团队,第一篇文章必然没有可链的目标。但从第二篇起,这项没过就该认真对待,孤岛文章拿不到站内的流转——而且链接必须是带 href 的 <a> 标签才会被抓取,靠脚本点击跳转的「链接」不算数。
第二层:编辑评审读什么
九项都过了,只说明这篇稿子没有明显的机械缺陷。它仍然可能整篇是编的。第二层要判的其实就是 Google 那份「以人为先的内容」自查清单反复在问的问题:读完的人有没有觉得这一趟没白来。
第二层交给会阅读的判断者,按四个维度打分:
- 事实准确性。 文章里关于产品、价格、能力、时间的陈述,是否和真实情况一致。
- 结构清晰度。 各节的顺序是否服务于读者的问题,有没有前后重复。
- 语言自然度。 读起来像不像人写的,有没有明显的机器语体。
- 搜索意图覆盖。 带着这个问题来的人,读完能不能拿到答案,还是只拿到一堆背景介绍。
四个维度之外,还有一项单独跑的检查:有没有编造的产品主张。它不打分,只回答有或没有。理由在下一节。
这一层模型和人都能做,实践中最好都有。模型快、不会累,但对同一篇稿子的判断会有波动,也不知道你的产品下周要不要涨价。人正好相反。
不许拉平均
这是整套设计里最容易做错的一处。
一个自然的做法是:四个维度各打一个分,取平均,过线就发。听起来公平,实际上它把一类致命缺陷变成了可以被赎买的。
设想一篇稿子结构清晰、语言自然、意图覆盖到位,这三项都很高,事实准确性因为编了一个不存在的功能被打得很低。取平均,总分照样漂亮,稿子照样发出去。读者点进产品页找不到那个功能,损失的是信任,而这笔损失不会因为另外三项写得好而减少半分。
平均分的隐含假设是各维度可以互相替代。对文笔和结构来说这大致成立,读起来生硬一点可以被结构清楚补回来。对事实来说它不成立。写得再流畅,也补不回一句编出来的功能。
所以自动通过要同时满足两个条件:没有编造声明,并且事实准确性单独过线。四维平均要够,事实准确性还得自己够,两个都得满足。哪怕平均分冲得很高,事实准确性没过线也不放行。
这条原则不依赖任何工具。组织人工评审时同样适用:让评审人分开填「事实有没有问题」和「读起来怎么样」两栏,别收一个笼统的印象分。合成一个数字之后,你就再也读不出哪里出了问题。
没过之后做什么
判定完只是一半,剩下一半是流程。
硬指标没过的稿子,值得定向重写一轮:把没过的那几项连同实测值一起给回去,让它只修这几处。整篇重生成随机性太大,原本过了的项可能这一轮反而挂掉。
重写一轮仍然不过,就该标出来转人工。反复自动重试通常不会收敛,两次都在同一处失败,多半是模型自己解决不了:可能选题撑不起这个篇幅,可能缺少可引用的来源,也可能它对某个事实的理解一开始就是错的。
所以结果一共三种去向:自动通过、重写一轮、转人工复核。中间那档能省掉大部分人工。
一份可以直接用的顺序
手上就是一篇 AI 刚写完的稿子的话,按这个顺序检最省时间:
- 先数能数的。 标题和描述长度、H2 个数、正文长度、目标词出现次数、图片 alt、外链和内链数量。哪项不合格先改哪项,别急着读全文。
- 再扫套话密度。 用一张固定的句式表通篇搜一遍,看命中的类别和总次数,不逐句评判。
- 然后逐条核对事实。 把关于产品、价格、时间、能力的陈述挑出来列成一行行,逐条回产品文档里对。这一步不能跳,也不能采样。
- 单独问一遍有没有编造。 尤其检查那些写得特别顺、特别笃定的句子,编造往往出现在模型最自信的地方。
- 最后才读文笔和结构。
- 修完从第 1 步重跑。 改动会影响长度和密度,跳过重跑等于凭运气发布。
前四步都能自动化,第五步不能。
这套门槛怎么自动跑
上面这套手工也能做,只是前两步这种纯机械劳动最容易被跳过。
SEO 长文生成把这两层门槛做成了固定环节:每篇成稿先过上述 9 项确定性检查,逐项给结果和实测值,通过的项也列出来;过了才进编辑评审,四维打分加一遍单独的编造声明检查。自动通过的条件就是上面那两条,不拉平均。硬失败的稿子自动定向重写一轮,仍然不过就标成需复核,不会悄悄发出去。
系统给的是检查结果,不是发布许可。价格、上线时间、对外承诺这些,最终还是你自己签字。
常见问题
能不能让模型一次性把九项也一起检了?
技术上可以,实践中不划算。模型回答「标题有多少个字」并不稳定,而这类问题写十行代码就有确定答案。交出去既浪费判断力,又让本来可复现的结论每次都不一样。
套话检查会不会误伤正常写作?
按密度设阈值就不太会。任何一个句式偶尔用一次都是合法的中文,问题出在成片使用,所以判定看的是命中的类别数和总次数,而不是有没有命中。要收紧就往已有类别里加句式,别新增类别,后者会悄悄改掉整个口径。
事实核对能自动化吗?
只能自动化一半。模型可以把事实性陈述挑出来,也可以拿它和你提供的产品资料比对,这两步都省人力。但「我们下个月要改价」这类不在任何文档里的事只有你知道。所以事实这层保留人工签字,工具负责把待核对的清单整理好。
