Skip to content

一个面向长书稿的延伸实现,附互相链接的提议 #33

Description

@dbhosbu-dotcom

你好,先说明来意:我做了一个同方向但不同层的工具,想提议在 README 里互相链接。

Humanizer-zh 我用了挺久,24 条规则对段落级的 AI 腔调清理得很干净。

但我在编一本 13 万字的健康科普书稿时撞到一类它(以及所有段落级工具)结构上覆盖不到的问题:

  • 第 2 章说辅酶 Q10 一天 100mg,第 7 章说 30mg 起步
  • 开篇承诺「本书不讲复杂的生化通路」,第 4 章讲了 20 页
  • 基因在第 1 章是「蓝图」,第 3 章是「开关」,第 5 章是「交响乐队」
  • 第 12 章一句「研究表明」,查无此文

共同点是:单看任何一章都挑不出毛病,必须读完整本书才能发现。

我做的东西

人味 Renwei — 51 条规则,其中 5 条专攻长上下文一致性(论点漂移、前后矛盾、承诺对账、比喻意象域冲突、知识幻觉)。另外多了欧化中文深度修复和 4 条正面写作技法。

两个可能对你也有参考价值的点:

  1. 双通道:能量化的(破折号密度、冒号、三项排比、拟人化)抽成 metrics.json 用纯正则跑,不烧 token;需要判断的才交给模型。实测里这个设计抓到过一次真问题——模型清掉了全部拟人化,却自己引入破折号滥用,每千字 6 个超标 6 倍。模型看不见自己的统计习惯。

  2. profile 覆写机制:写小说时要把一部分规则关掉。「风推开了门」在科普里是伪生动,在小说里是笔法。所以 --profile fiction 会禁用去拟人化等规则,另加 10 条虚构专属。

提议

定位上我理解是两层不是两家:你处理段落,我处理整本书,用户很可能两个都需要(先跑你的清句子,再跑我的校全书)。

如果你觉得合适,我在人味的 README 里加一句推荐 Humanizer-zh 作为段落级方案,也希望你能在你的 README 里提一句长书稿场景可以看看人味。不合适也完全没关系,这个 issue 你可以直接关掉。

顺便,Humanizer-zh 的规则我在做适配时没有直接复制,中文规则来自我自己的编书稿实战,英文部分同样溯源到 Wikipedia 的 Signs of AI writing。如果有任何署名上的疏漏请告诉我,我马上改。

Kevin Zhang

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions