你好,先说明来意:我做了一个同方向但不同层的工具,想提议在 README 里互相链接。
Humanizer-zh 我用了挺久,24 条规则对段落级的 AI 腔调清理得很干净。
但我在编一本 13 万字的健康科普书稿时撞到一类它(以及所有段落级工具)结构上覆盖不到的问题:
- 第 2 章说辅酶 Q10 一天 100mg,第 7 章说 30mg 起步
- 开篇承诺「本书不讲复杂的生化通路」,第 4 章讲了 20 页
- 基因在第 1 章是「蓝图」,第 3 章是「开关」,第 5 章是「交响乐队」
- 第 12 章一句「研究表明」,查无此文
共同点是:单看任何一章都挑不出毛病,必须读完整本书才能发现。
我做的东西
人味 Renwei — 51 条规则,其中 5 条专攻长上下文一致性(论点漂移、前后矛盾、承诺对账、比喻意象域冲突、知识幻觉)。另外多了欧化中文深度修复和 4 条正面写作技法。
两个可能对你也有参考价值的点:
-
双通道:能量化的(破折号密度、冒号、三项排比、拟人化)抽成 metrics.json 用纯正则跑,不烧 token;需要判断的才交给模型。实测里这个设计抓到过一次真问题——模型清掉了全部拟人化,却自己引入破折号滥用,每千字 6 个超标 6 倍。模型看不见自己的统计习惯。
-
profile 覆写机制:写小说时要把一部分规则关掉。「风推开了门」在科普里是伪生动,在小说里是笔法。所以 --profile fiction 会禁用去拟人化等规则,另加 10 条虚构专属。
提议
定位上我理解是两层不是两家:你处理段落,我处理整本书,用户很可能两个都需要(先跑你的清句子,再跑我的校全书)。
如果你觉得合适,我在人味的 README 里加一句推荐 Humanizer-zh 作为段落级方案,也希望你能在你的 README 里提一句长书稿场景可以看看人味。不合适也完全没关系,这个 issue 你可以直接关掉。
顺便,Humanizer-zh 的规则我在做适配时没有直接复制,中文规则来自我自己的编书稿实战,英文部分同样溯源到 Wikipedia 的 Signs of AI writing。如果有任何署名上的疏漏请告诉我,我马上改。
Kevin Zhang
你好,先说明来意:我做了一个同方向但不同层的工具,想提议在 README 里互相链接。
Humanizer-zh 我用了挺久,24 条规则对段落级的 AI 腔调清理得很干净。
但我在编一本 13 万字的健康科普书稿时撞到一类它(以及所有段落级工具)结构上覆盖不到的问题:
共同点是:单看任何一章都挑不出毛病,必须读完整本书才能发现。
我做的东西
人味 Renwei — 51 条规则,其中 5 条专攻长上下文一致性(论点漂移、前后矛盾、承诺对账、比喻意象域冲突、知识幻觉)。另外多了欧化中文深度修复和 4 条正面写作技法。
两个可能对你也有参考价值的点:
双通道:能量化的(破折号密度、冒号、三项排比、拟人化)抽成
metrics.json用纯正则跑,不烧 token;需要判断的才交给模型。实测里这个设计抓到过一次真问题——模型清掉了全部拟人化,却自己引入破折号滥用,每千字 6 个超标 6 倍。模型看不见自己的统计习惯。profile 覆写机制:写小说时要把一部分规则关掉。「风推开了门」在科普里是伪生动,在小说里是笔法。所以
--profile fiction会禁用去拟人化等规则,另加 10 条虚构专属。提议
定位上我理解是两层不是两家:你处理段落,我处理整本书,用户很可能两个都需要(先跑你的清句子,再跑我的校全书)。
如果你觉得合适,我在人味的 README 里加一句推荐 Humanizer-zh 作为段落级方案,也希望你能在你的 README 里提一句长书稿场景可以看看人味。不合适也完全没关系,这个 issue 你可以直接关掉。
顺便,Humanizer-zh 的规则我在做适配时没有直接复制,中文规则来自我自己的编书稿实战,英文部分同样溯源到 Wikipedia 的 Signs of AI writing。如果有任何署名上的疏漏请告诉我,我马上改。
Kevin Zhang