LinkBlm
‹ 资源中心

AI 写的长文发布前怎么检:先过能数的,再过要读的

AI 长文翻车通常不在文笔,而在编造功能和通篇注水。本文把发布前的检查拆成确定性检查与编辑评审两层,讲清 9 项可以自动跑的指标、4 个必须人读的维度,以及为什么不能用一个总分收尾。

LinkBloom 产品与增长团队12 分钟阅读更新于 2026年8月25日

要点速览

  • 检查分两层:能数出来的交给规则,要读懂的才交给模型和人。
  • 一个总分会把「写得挺顺」和「编了个不存在的功能」压成同一个数字。
  • 事实准确性单独设一条线,其它维度分再高也不能替它补分。
  • 硬指标没过的稿子先定向重写一轮,仍然不过就转人工,别在同一处反复重生成。

AI 长文的发布前检查分两层:能数出来的交给规则,要读懂的才交给模型和人。事实准确性单独设一条线,其它维度分再高也不能替它补分。硬指标没过的稿子先定向重写一轮,仍然不过就转人工,别在同一处反复重生成。

一篇 AI 写的长文交到手里,人的第一反应通常是通读一遍,觉得「还行」,改两个措辞就发了。

通读时最容易注意到的是句子顺不顺,最不容易注意到的恰恰是两件要命的事:文章里提到的某个产品功能其实不存在;两千多字里有八百字在说正确的废话。前者会让读者上门问「你们这个功能在哪」,后者会让整篇文章在搜索结果里没有位置。

先决定哪些交给规则,哪些交给人

把待检的问题摊开看,它们分成两类。

一类能数出来。标题多少个字、正文有几个 H2、目标词全文出现几次、有没有外部引用,这些都有唯一答案,谁来数结果都一样,成本接近于零。

另一类必须读懂才知道。这句话是不是编的、结构对读者的问题有没有回答到位、语言像不像人写的,规则表达不了,只能交给会阅读的判断者,可以是模型,也可以是人。

把两类混在一起,让模型一次看完全文打个总分,两边的好处都丢了。

规则那边丢掉的是可复现和可解释。同一篇稿子送给模型两次,标题长度这项可能一次说合适一次说偏短;规则给出的则是「标题 18 个字,区间 20 到 60,短了 2 个字」,审稿人不用信任任何黑箱就能直接去改,改完还能立刻重跑。

模型那边丢掉的是注意力。让它同时管标题字数和事实真伪,等于把有限的判断力摊薄在九个它本来就不擅长的机械指标上。规则先筛干净,模型的输出预算才能全花在语义上。

第一层:9 项确定性检查

下面是我们实际在跑的九项,每项给「合格 / 不合格」加实测值,不打分。手工照着检一遍也可行,只是慢。

元信息三项

标题长度。 我们的口径是 20 到 60 个字符。它的代价发生在页面之外:Google 会在结果页里改写或截断过长的标题链接,分享卡片同理,超长标题会在最有信息量的地方被切掉。典型的不合格是模型把整句话当标题写,四十几个汉字里前二十个都在铺垫。

描述长度。 70 到 160 个字符。它和标题是一对,在结果页里回答「点进去有什么」。Google 说明摘要可能直接取自 meta description、也可能从正文另选一段,所以这段字要能独立成立。两种极端都常见:一句十几个字的空话,或者把首段原封不动复制进去,后半截根本显示不出来。

H2 结构。 至少 3 个二级标题。检的是文章有没有真的被分成几件事来讲。AI 写长文很容易滑成一大坨连续段落,每句都通,但读者没法跳读,也没法从目录判断这篇讲不讲他关心的那件事。少于三个 H2,通常说明压根没规划过结构。

篇幅与用词三项

正文长度。 中文 1200 到 2500 字,英文 700 到 1500 词。下限是因为八百字很难把一个有搜索量的问题讲完;上限是因为长度一旦失控,注水的比例几乎必然上升。不合格时别急着让模型「再扩写一点」,先确认是内容不够,还是选题撑不起这个长度。

关键词密度。 目标词全文出现 3 到 12 次。下限保证文章确实在讲这个题目,上限拦硬塞。低于下限往往是模型写着写着跑了题;超过上限读起来会有明显的机械感,同一个词在相邻两段里出现四五次。

套话密度。 这项最容易做错。我们用一张句式表抓「在这个…时代」「随着…的发展」「值得注意的是」「综上所述」这类空话,判定标准是两个上限:命中的句式类别不超过 2 类,总次数不超过 5 次。偶尔一句不算问题,成片出现才记一笔。

逐句挑刺的检查会被审稿人训练成噪声,看两次就再也不看了;通篇注水恰恰是密度问题,单看每句都挑不出毛病,连起来读才发现两千字里有一半没提供信息。所以这项在我们这里只记提醒、不拦截:文笔值得说一句,但不值得为它整篇打回。

引用与链接三项

图片 alt。 正文引用的每张图都要有 alt 文本。它属于极少数「漏了完全没有提示」的东西:页面照样渲染,读者照样看图,只有依赖读屏软件的人和抓图的爬虫会碰壁。这两头各有明确要求——WCAG 2.2 把非文本内容的等价文本列为 A 级要求Google 图片也把 alt 当作理解图片内容的主要依据。缺失算硬失败,补一句描述比漏掉便宜太多。

外部引用。 至少 2 条。检的是文章的说法有没有来处。零引用的 AI 长文,所有断言只能追溯到模型自己,审稿人无从核对。还有一种更麻烦的不合格:引用了,但链接指向不存在的页面,所以这项最好连带跑一次可达性验证。

站内互链。 至少 1 条。它是九项里唯一的软性检查,只提醒不拦截,原因很实际:刚开始建内容站的团队,第一篇文章必然没有可链的目标。但从第二篇起,这项没过就该认真对待,孤岛文章拿不到站内的流转——而且链接必须是带 href 的 <a> 标签才会被抓取,靠脚本点击跳转的「链接」不算数。

第二层:编辑评审读什么

九项都过了,只说明这篇稿子没有明显的机械缺陷。它仍然可能整篇是编的。第二层要判的其实就是 Google 那份「以人为先的内容」自查清单反复在问的问题:读完的人有没有觉得这一趟没白来。

第二层交给会阅读的判断者,按四个维度打分:

  • 事实准确性。 文章里关于产品、价格、能力、时间的陈述,是否和真实情况一致。
  • 结构清晰度。 各节的顺序是否服务于读者的问题,有没有前后重复。
  • 语言自然度。 读起来像不像人写的,有没有明显的机器语体。
  • 搜索意图覆盖。 带着这个问题来的人,读完能不能拿到答案,还是只拿到一堆背景介绍。

四个维度之外,还有一项单独跑的检查:有没有编造的产品主张。它不打分,只回答有或没有。理由在下一节。

这一层模型和人都能做,实践中最好都有。模型快、不会累,但对同一篇稿子的判断会有波动,也不知道你的产品下周要不要涨价。人正好相反。

不许拉平均

这是整套设计里最容易做错的一处。

一个自然的做法是:四个维度各打一个分,取平均,过线就发。听起来公平,实际上它把一类致命缺陷变成了可以被赎买的。

设想一篇稿子结构清晰、语言自然、意图覆盖到位,这三项都很高,事实准确性因为编了一个不存在的功能被打得很低。取平均,总分照样漂亮,稿子照样发出去。读者点进产品页找不到那个功能,损失的是信任,而这笔损失不会因为另外三项写得好而减少半分。

平均分的隐含假设是各维度可以互相替代。对文笔和结构来说这大致成立,读起来生硬一点可以被结构清楚补回来。对事实来说它不成立。写得再流畅,也补不回一句编出来的功能。

所以自动通过要同时满足两个条件:没有编造声明,并且事实准确性单独过线。四维平均要够,事实准确性还得自己够,两个都得满足。哪怕平均分冲得很高,事实准确性没过线也不放行。

这条原则不依赖任何工具。组织人工评审时同样适用:让评审人分开填「事实有没有问题」和「读起来怎么样」两栏,别收一个笼统的印象分。合成一个数字之后,你就再也读不出哪里出了问题。

没过之后做什么

判定完只是一半,剩下一半是流程。

硬指标没过的稿子,值得定向重写一轮:把没过的那几项连同实测值一起给回去,让它只修这几处。整篇重生成随机性太大,原本过了的项可能这一轮反而挂掉。

重写一轮仍然不过,就该标出来转人工。反复自动重试通常不会收敛,两次都在同一处失败,多半是模型自己解决不了:可能选题撑不起这个篇幅,可能缺少可引用的来源,也可能它对某个事实的理解一开始就是错的。

所以结果一共三种去向:自动通过、重写一轮、转人工复核。中间那档能省掉大部分人工。

一份可以直接用的顺序

手上就是一篇 AI 刚写完的稿子的话,按这个顺序检最省时间:

  1. 先数能数的。 标题和描述长度、H2 个数、正文长度、目标词出现次数、图片 alt、外链和内链数量。哪项不合格先改哪项,别急着读全文。
  2. 再扫套话密度。 用一张固定的句式表通篇搜一遍,看命中的类别和总次数,不逐句评判。
  3. 然后逐条核对事实。 把关于产品、价格、时间、能力的陈述挑出来列成一行行,逐条回产品文档里对。这一步不能跳,也不能采样。
  4. 单独问一遍有没有编造。 尤其检查那些写得特别顺、特别笃定的句子,编造往往出现在模型最自信的地方。
  5. 最后才读文笔和结构。
  6. 修完从第 1 步重跑。 改动会影响长度和密度,跳过重跑等于凭运气发布。

前四步都能自动化,第五步不能。

这套门槛怎么自动跑

上面这套手工也能做,只是前两步这种纯机械劳动最容易被跳过。

SEO 长文生成把这两层门槛做成了固定环节:每篇成稿先过上述 9 项确定性检查,逐项给结果和实测值,通过的项也列出来;过了才进编辑评审,四维打分加一遍单独的编造声明检查。自动通过的条件就是上面那两条,不拉平均。硬失败的稿子自动定向重写一轮,仍然不过就标成需复核,不会悄悄发出去。

系统给的是检查结果,不是发布许可。价格、上线时间、对外承诺这些,最终还是你自己签字。

常见问题

能不能让模型一次性把九项也一起检了?

技术上可以,实践中不划算。模型回答「标题有多少个字」并不稳定,而这类问题写十行代码就有确定答案。交出去既浪费判断力,又让本来可复现的结论每次都不一样。

套话检查会不会误伤正常写作?

按密度设阈值就不太会。任何一个句式偶尔用一次都是合法的中文,问题出在成片使用,所以判定看的是命中的类别数和总次数,而不是有没有命中。要收紧就往已有类别里加句式,别新增类别,后者会悄悄改掉整个口径。

事实核对能自动化吗?

只能自动化一半。模型可以把事实性陈述挑出来,也可以拿它和你提供的产品资料比对,这两步都省人力。但「我们下个月要改价」这类不在任何文档里的事只有你知道。所以事实这层保留人工签字,工具负责把待核对的清单整理好。

AI长文质检内容质量检查SEO文章审核AI写作检查清单内容发布流程

继续实践

用自己的产品,把方法跑一遍。

LinkBloom 从产品事实出发推演方向、生成版本,并按任务设置素材与品牌保留约束。注册即得一次性 100 积分,无需信用卡。