Style anchor fusion
Skill foreverse-app/character-card-skills/skills/style-anchor-fusion
写前深读真书语料 → 落「腔调锚笔记」→ 与反AI味纪律双管齐下的仿写工序(corpus-grounded style mimicry)。触发场景:写长篇小说、写角色卡卡面文案(简介/开场白/示例对话)、任何「要像真人书的成文」任务,以及「文风太 AI / too AI-flavored / 一股 GPT 味」的修复诉求。证据口径(8 部 10 万字同题实验 + 人工质询复核,§8):机器验证成立的=纪律词表把套话压到 0.00、语料贡献词汇/物象/话术层;「盲评第一」经复核降级为 LLM 评委偏好,不再当工序有效性证据;最重教训=碎句文艺腔是模型自带笔癖,读语料改不动句子形状,须显式禁令+指纹验收(§5.5/§5.6)。分工原则一句话:纪律管「禁什么」,语料管词汇/物象/话术层的「像什么」。配套工具:防抄袭滑窗闸 tools/plagiarism_check.py + 碎句指纹普查 tools/fragment_census.py。From its SKILL.md
npx -y skills add foreverse-app/character-card-skills --skill style-anchor-fusionAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
3 things to look at
- 24 days oldThe repository was created 24 days ago. New is not bad, but a brand new repository carrying a familiar-sounding name is the shape a typosquat arrives in, and there has been no time for anyone else to find a problem with it.
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
- 2 stars2 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
SKILL.md
23.9 KB, ~10.1k tokens by cl100k_base, as published. Nobody here has run it
语料腔调锚融合仿写(style-anchor-fusion)
让模型写得像真人书,「读真书」和「守禁令」都要上,但各管哪层要按证据说清(8 部 10 万字 同题盲写实验 + 人工质询复核的口径,出处见 §8):纪律管词表层——把套话压进真人带是 机器验证的;语料管词汇/物象/话术层——衙门腔怎么说、器物叫什么、行话怎么盘,对读实例 可证;句子的「形状」两样都管不动——碎句文艺腔是模型自带笔癖,读了 74 万字语料照样 剁句,只能靠显式禁令+指纹验收(§5.5/§5.6)。本 skill 固化的工序:写前深读语料 → 落腔调锚笔记 → 与反 AI 味纪律双管写作 → 回锅防漂 → 完稿滑窗自查 + 碎句指纹验收。
三条铁律先立住:
- 语料必须与反 AI 味纪律绑定上岗。只喂语料不叠纪律=负增益——机器计量实锤(人工 复核后这条只有加强没有松动):纯语料组套话没人拦照样失控,句式层也什么都没学到 (碎句指纹反而是全场最差之一,裸数量词同位插入 2.64 处/万字全场最高、三本语料本身 为 0)。光读三本书,词表和句式两层都没有自动收益,写出来「像但脏」。
- 分工原则:纪律管「禁什么」,语料管「像什么」——「像什么」的实证范围是词汇/物象/ 话术层。纪律给负面清单(套话黑名单、句式配额、结构反均匀);语料给正面模板(声口 用词、称谓话术、行业细节、闲笔取材)。句式节奏层语料管不动(§5.5),冲突时纪律优先 (裁决实例见 §5)。
- 学声不抄字。仿写全部发生在风格层:禁连抄 ≥15 字、语料专名零出现、完稿跑滑窗 自查(§6)。实验 6 部语料组作品 64,265 个滑窗 0 命中,证明这条红线完全可执行。
反 AI 味纪律本体不在本文件:卡面文案的句式纪律见本仓库
skills/character-card-author/(卡面句式纪律七病灶 + 文风选型层),独立文本体检用
tools/ai_flavor_check.py;长篇场景按同一思路配齐三件——套话黑名单、句式配额
(如「不是A而是B」≤3/10万字)、结构反均匀(句长方差要大 / 每卷至少 2 处闲笔 /
章节结构禁同构)。本 skill 只管语料侧工序与两者的叠加方式。
1. 选语料:三本法
同题材可融域内选 2-3 本真人书,功能互补分工:
| 角色 | 管什么 | 实验实例(命题=东方古典灵异探案) |
|---|---|---|
| 骨架 | 情节推进节奏、主线参照系、爽点结构 | 《大奉打更人》:探案链条、衙门生态、官场市井话术 |
| 氛围 | 题材质感、场景肌理、悬念手法 | 《捞尸人》:民俗恐怖的日常肌理、章尾断句、乡土声口 |
| 文笔上限 | 文字密度天花板、修辞档位 | 《赤心巡天》:散文化短段、古典对仗、诗意留白 |
选书判据:
- 三本的风格轴要互相正交(爽文腔/氛围腔/文笔腔各管一摊),融合才有真实的信息增量, 同质的三本=堆料不是养分。
- 落选逻辑也要想清楚:题材次贴但语域错位的书只能当氛围源不能当骨架(《捞尸人》题材 贴「灵异」但背景是 1980s 现代水乡,与王朝背景语域错位);文笔最强但缺命题核心元素的书 单仿会把稿子写飘(《赤心巡天》探案元素为零)。
- 反例警告:跨语域硬融是噪音。实验刻意不塞第 4 本——女频/西幻/电竞语料与东方古典 灵异命题语域错位,塞进去只会稀释腔调。宁缺毋滥,2 本互补好过 4 本混杂。
单本深仿的适用场景:题材极贴(场景语汇可直接借用不发生时代/语域错位)且风格强烈 可辨识(仿没仿到肉眼可判)时可以只深仿一本。但要知道它是高方差选项:商业书连读者群 定位一起继承(实验里深仿爽文的那部在不同口味的 LLM 评委间座次从第 1 波动到第 5——座次 本身只是评委偏好,但这么大的波动恰说明口味绑定被整体继承),连排版层(弯引号)都会被 迁移;语料自带的表演性腔调(吐槽体、四点省略号)会跟文体统一度打架。拿不准就走三本融合。
2. 深读量标准
- 骨架本细读 ≥10 章,其余各本 ≥8 章(实验用量参照:单本深仿组细读了约 30 章 12.8 万 字才动笔;融合组三本各按功能深读+跳读)。
- 「细读」= 边读边摘:读的时候就在写 §3 的腔调锚笔记,摘句、记手法、列禁用专名。读完 合上书能凭笔记复述这本书「开章怎么开、收章怎么收、对话什么腔」才算读到位。
- 深读发生在动笔前,笔记落盘后才开写。写作中途的语料接触走 §4 回锅纪律。
3. 腔调锚笔记(style-notes.md)规范
笔记放作品的工作区(与大纲、写作账本并列),动笔前完成。六个维度必须覆盖:
- 句式节奏(段长、短句/长句配比、单句成段用在哪)
- 开章 / 收章手法(开场几式、章尾钩子形态、断句技法)
- 对话腔与称谓(说话人标签怎么打、称谓体系、追问链/话术)
- 内心戏处理(独白挂谁身上、什么时刻骤停、与叙述怎么切换)
- 描写密度与位置(人物几笔立起来、环境描写占比、数字怎么用)
- 爽点 / 悬念排布(核心循环、压与弹、日常戏的位置)
每本摘 5 段 ≤50 字原文当「腔调锚」——写作中途翻回来对耳朵用的,选最能代表该书 声口的句子,并标注它锚的是什么手法。(腔调锚是你的私人笔记,摘句留在笔记里;红线管的 是成文里不得出现语料原文与专名,见 §6。)
笔记模板(结构提炼自实验融合+纪律组的真实笔记;示例句为自造示意,不是任何语料原文):
# 《作品名》融合配方(写前完成;写作全程翻回来看,每 5 章自查一次)
## 1. 各本风格 DNA(每本一节)
### 1.x 《某书》=氛围(一句话说清它管什么)
腔调锚(原文摘句,≤50 字,各标注锚的手法):
1. 「这行的规矩,钱要当面点清,话不能当面说破。」——行话+对仗的市井声口
2. 「河面静得很,静得像有人在下面听。」——日常物象上长出来的恐怖
…(共 5 句)
风格要点:
- 恐怖长在日常上:先把粥、烟、赊账写瓷实,鬼才吓人。恐怖场景的前置日常至少占同章三分之一。
- 章尾断句:砍在半句上(「她,」「忽的,」),下一章开头补完这口气。不能每章都用,轮换着来。
- **注意:不学什么**——老人口头骂自造本作世界的版本,不照搬原词。
## 2. 融合规则(什么场景用什么腔)
| 场景 | 主腔 | 副腔 | 备注 |
| 衙门、查案、审讯 | 骨架本 | 氛围本(声口) | 对话推进,每章疑点链至少进一步 |
| 抒情、生死重场 | 文笔本 | 骨架本(吐槽解压) | 短段与对仗的唯一大额预算区 |
衔接手法:腔调切换过「物件桥」;抒情段连续 ≤3 段必须落回动作或对话。
## 3. 角色声口指纹(台词盖住名字也认得出,每主要角色一行)
- 主角:规程口诀挂嘴边,心里算账毒舌,嘴上话少。
- 配角甲:句尾爱带「记住喽」;配角乙:官腔,句句「按例」。
## 4. 专名禁用清单(语料书人名/地名/机构/功法/标志性桥段,一个不许出现在正文)
## 5. 纪律自查清单(套话黑名单 + 句式配额 + 结构反均匀,抄关键条进来)
要点:融合规则表是三本法的灵魂——腔不是拌匀的,是按场景分片的;声口指纹一旦写下, 每个角色的台词就有了可自查的判据;纪律清单抄一份进笔记(而不是只留引用),是为了 §4 说的「上下文压缩后重读」时一份文件管够。
4. 回锅纪律(防漂)
写作是长跑,腔调会漂——要么漂成单一来源(三本融合塌缩成只剩骨架本的腔),要么漂回 模型默认腔(越写越「GPT」)。机器复核证实劣化是连续趋势不是断点(实验里套话密度 最失控的一部:前半 41.7 → 后半 199.7 次/10 万字,恶化 4.8 倍),所以检查要定期、要盯后半程:
- 每写 5 章,回语料各抽读 1 章,对耳朵;同时把 §3 笔记的纪律自查清单过一遍。
- 按字数不按章数设检查点:每 2 万字一次自查,重点抽自己最近写的 5 章——套话计数、 章长轨迹(末/首比 <0.7 = 密度衰减警报)、声口串味。
- 「¼ 处与 ¾ 处各跳读一章对比声口」:实验评委的工作法,直接抄来自查——两处声口 对不上就是漂了。
- 长篇账本纪律:写作账本(state 文件)每 4-5 章更新一次(主线进度/人物状态/伏笔 账本/时间线);agent 上下文被压缩后,先重读 style-notes.md + 大纲 + 最近 2 章, 再续写——笔记是压缩失忆后唯一能把腔调找回来的锚。
5. 与反 AI 味纪律叠加(本 skill 的命门)
分工原则:纪律管「禁什么」,语料管「像什么」。 语料给正面模板(衙门话术怎么说、 章尾怎么断、闲笔密度多少),纪律给负面清单(套话黑名单、句式配额、结构反均匀)。 单独任何一个都不够:
- 只有纪律 = 干净但没有来源(套话 0.00 是机器验证的,禁令确实管用;但词汇/物象/ 话术层没处学——衙门腔、行话、器物细节这些正面模板,禁令给不出来)。
- 只有语料 = 像但脏(写手自述+机器计量双实证:「黑名单词有惯性肌肉,会在不设防的 描写句里自己长出来」——没有禁令拦着,读再多真书套话照样漫出来;且句式层也不会自动 变像,见 §5.5)。
冲突裁决(两个实战实例,都出自实验融合+纪律组):
- 语料高频词撞黑名单 → 纪律优先,保节奏换写法。语料书常用「瞳孔一缩」,它在黑名单 里——不是不写这个节拍,是把「情绪命名」换成动作外化(手上的动作、物件的反应)。 一句话:腔调跟语料走,词表跟纪律走。
- 语料的梗与本作设定冲突 → 保「声口神态」剔「形」。语料书的现代穿越梗(网络语、 现代名词吐槽)与古典设定冲突——吐槽腔保留(心里算账、毒舌、自嘲的神态),内容 全部本土化(用本作世界的语汇:灯油、铜钱、行话)。学的是「怎么损」,不是损的那句词。
加粗警告(写死,不许绕):只喂语料、不叠反 AI 味纪律 = 负增益。 机器计量:纯语料组套话密度失控无人拦,碎句指纹还是全场最差之一(裸数量词同位插入 2.64 处/万字全场最高)——词表层与句式层双输,人工复核后这条结论只有加强没有松动。 语料工序的全部收益都以纪律在场为前提;砍纪律留语料,等于白读三本书还倒贴。
终扫尺度:别追求「绝对零」。把黑名单压到 0.00 反而低于所有真人书的毛边水平(16 本 真人网文实测基线:最干净的也有 0.09 次/万字),「过度干净」本身是一种反向指纹。目标设在 真人带内(≤1 次/万字量级)即可,省下的返工预算投到闲笔和配角声口上——对读层面可感的 差距在那,不在把词表从 0.5 磨到 0。
5.5 碎句腔警戒(句式层禁令——语料管不到的那层)
人工质询复核的最重发现:逗号剁碎的「碎句文艺腔」是模型自带笔癖,不是从语料学来的 ——零语料输入的裸写稿写出了与融合稿几乎同款的碎句腔(「渡口,渡官。」「到底没有回。」), 剥对话后的叙述碎句指纹两稿同档;而全部真人书(含三本语料 74 万字)的叙述基底是中长句, 碎句只是偶尔打在情绪峰值上的浪尖(语料实测:惊悚名场面三十行只打 3 记碎句,全部在峰值 上)。读语料不会矫正句子形状,必须显式禁令 + 写后指纹验收。
三条句式禁令(用量以三本语料实测为据):
- 裸数量词同位插入——禁用。「碑不高,四尺,碑身黑」型:两逗号间只悬一个裸尺寸词、 给前一小句补规格。三本语料 74 万字零命中,纯模型自造。(递进列举「一圈,两圈,三圈」 语料真有,不在禁列。)
- 时间悬置判断句——每卷 ≤1。「今夜,是他的手了」型:时间词单独剁出来、再用 「是……了」做抒情宣告。语料零命中——语料里的「,是……了」全部是对话应答与口语推断 (「哦,是我想错了」),没有一例叙述性抒情悬置。
- 悬空设景段——≤18 段/万字,且只用于章首/换场。「雾里,梆子响了」「入夜,布防。」 型:方位/时间词+逗号+短主谓(或直接悬名词)独立成段。这个形状语料真有——《大奉打更人》 全书第一句就是「大奉京兆府,监牢。」——但语料把它当章首换场的锣,一章敲一两记, 敲完立刻回长句叙事;把它写成正文常规节拍(隔几行一记)就是放大 2~5 倍的机器腔。 18 段/万字是三本语料带上沿。
写后验收:跑碎句指纹普查,对照真人书区间——
python3 tools/fragment_census.py --target <成稿目录>
# 可加 --anchor 语料1.txt 语料2.txt 现场重锚区间;--examples 看命中原句;触告警退出码=1
真人书区间参考值(区间来自本实验 16 本真人书语料实测,下表列 3 本语料+2 本对照锚的 代表值;语料/题材换了要用 --anchor 重锚,别拿这组数当万题材通用——工具正则为中文 专用,英文场景保留思路重推指标):
| 指标(剥对话后叙述层,每万字归一) | 真人带 | 告警线 |
|---|---|---|
| ≤4 字小句占比 | 8~19% | — |
| 方位/时间起句 | 0~2.5 次 | — |
| 1-2 字独词句 | 0.1~2.1 条 | >5 条 |
| 裸数量词同位插入 | 0 | >0 |
| 悬空设景段 | 3~18 段 | >20 段 |
三条告警线当时能把 8 部机器稿里的 7 部与全部 5 本参照真人书分开。机理一句话:真人书的 碎句是浪尖、长句是水;机器稿的碎句是匀速鼓点——单句拿出来都「有文气」,连读就是腔。
5.6 验收纪律(文风验收不得只靠 LLM 互评)
本实验的四位 LLM 评委(四模型 × 四人设 × 四阅读序,互不通气)在「文风人味」维度给出了
方向相反的共识:把碎句指纹离真人书最远的稿子捧成「最像真人连载」,把八部里唯一一部
叙述指纹全线落在真人区间内的稿子全票骂文风倒二——奖惩方向与可测的真人书基准相反。这与
我们此前双盲实验(本仓库 docs/blind-review-experiment.md)「评委间一致率 86% 却一致
地错」同构:LLM 对「文学感」的先验彼此高度相关,头部共识不能当独立证据用。
硬性纪律:文风验收二选一,缺一不发——
- 人类抽读:抽首/中/尾各一段连续叙事(每段 250~400 字),与语料原文并排对读, 逐段问「这个句式/密度语料真有吗」;
- 真人书指纹锚:跑 §5.5 碎句指纹普查 + 套话密度,对真人区间机器对照。
LLM 互评仍可用,但只用于行级实锤的举证(整段重复、元叙事泄漏、套话计数、章长衰减 ——这些评委抓得准且可机器复核);「文风像不像人」的裁决权不交给它。
6. 防抄袭红线
仿写学的是「声」,不是「字」。三条硬线:
- 禁连抄 ≥15 字(纯汉字流口径,剔标点后算——标点改写掩盖不了抄袭)。
- 语料专名零出现:人名/地名/机构/功法/称号一个不许进正文,动笔前在笔记里列全 禁用清单(§3 模板第 4 节);标志性桥段的结构复用要变形到不可辨认,或干脆不用。
- 完稿跑滑窗自查,零命中才算过:
python3 tools/plagiarism_check.py \
--corpus 语料1.txt 语料2.txt 语料3.txt \
--target 成稿目录/ # 可加 --sample 5 抽首/¼/中/¾/末快查;退出码非零=有命中
实验独立抽验:6 部语料组作品 ×5 章、64,265 个 15 字滑窗 0 命中——这条红线不影响 仿写效果,没有任何借口踩它。
7. 模型雷区(长文选型与征兆自查)
同一份融合任务书发给四个模型,产出从 LLM 评委追捧到全票垫底(垫底侧有行级实锤)—— 换模型的影响比换方法更大。十万字级长文选型与雷区(证据=实验模型轴,行级/机器证据 为主;涉审美排序处已按复核口径标注;单次实验 n=1,当征兆清单用,别当最终裁决):
- 头部选型(注意:「头部」是 LLM 评委偏好,未过人类校准):Opus 5 最受 LLM 评委 喜欢(四个分项维度全第一),但它的悬空设景段密度是全场最高(每万字 76 段,语料带 4 倍以上)——评委给它文学分的恰是同一款碎句偏好,用它必须叠 §5.5 句式禁令;特征性 弱点=爽感供给偏弱、越写越长。Fable 5 + 本 skill 全套工序是性价比档(工序管住词表层 与防抄袭;句式层雷区见下条)。
- Fable 5 雷区:碎句文艺腔自带笔癖(裸写就有,读语料不矫正)。警戒征兆=三种句式: 裸数量词同位插入(「碑不高,四尺」型)、时间悬置判断句(「今夜,是……了」型)、 悬空设景段高密度(「入夜,布防。」隔几行一记)。自查法:跑 §5.5 碎句指纹普查对 真人区间;三条禁令直接写进任务书,别指望语料熏陶。
- Sonnet 系雷区:「情绪标注器」失控 + 后半密度衰减。征兆:「带着一丝/一丝」类情绪 命名词高频复现(实验实测 101 次/10 万字,且后半恶化 4.8 倍是连续趋势);章长断崖 (末 5 章/首 5 章比 0.42)。自查法:每 2 万字数一次「一丝」族计数 + 章长轨迹, 发现恶化趋势立即停,别指望它自愈。另一面要如实记:它的句子形状反而是八部里唯一 全线落在真人书指纹区间内的——败在套话失控与长程密度,不败在腔调。
- Grok 系雷区:长程梗概化坍缩 + 元叙事泄漏。征兆:章均字数塌到千字以下(实验一跑
30 章仅 2.7 万字);写作术语混进正文(「卷一终」「钩子」「(补记)」「读者」);整段
逐字重复、模板段跨章轮换。自查法:
grep -n '卷一\|卷二\|钩子\|补记\|读者' 正文一行 拦截 + 连续 ≥30 字段级重复检查。警告:对长程密度失控的模型加字数硬约束是治标反弹 ——实验里加了「每章 2500-4500 字」条款后,坍缩转化为拿模板段和重复段凑字数。正解是 换模型或把长任务切短,不是加条款。短件豁免:该模型前两章的语言拿过评委「本轮最好 的一档」评价——它败在十万字尺度的自我管理,不败在笔力,角色卡开场白这类短件不必禁用。 - 四个机器闸(低成本预警器,与垫底两部的行级实锤一致):套话密度 ≤1.5 次/万字
(真人带上限)、「一丝/带着一丝」计数(失控部 149 次 vs 其他部 ≤16)、章长轨迹
末/首比 ≥0.7、碎句指纹三告警线(§5.5:悬空设景段 >20 段/万字、1-2 字独词句
5 条/万字、裸数量词同位插入 >0)。
8. 证据与出处
本 skill 的数字与结论出自我们 2026-07 的一次内部对照实验(style-fusion-bench)及其 后续的人工质询复核(人类读者质询冠军稿三句式驱动,用逐字引文对照+碎句指纹统计对 全部审美类结论做了二审):
- 写作:8 路互相隔离的 agent 同题盲写同一命题(东方古典灵异探案)各约 10 万字中文 长篇。方法轴 5 路(同模型):裸写 / 只给反AI味纪律 / 单本深仿 / 三本纯融合 / 三本融合 +纪律;模型轴 4 路(同任务书):Fable 5 / Opus 5 / Sonnet 5 / Grok 4.5。
- 评审:8 部匿名化后由四位 LLM 评委(四模型 × 四人设 × 四阅读序)盲评,只做同题
相对排序+引文举证,不做「是/不是 AI」绝对断言(我们此前的双盲实验证明 LLM 评委的
绝对判断不可靠,见本仓库
docs/blind-review-experiment.md);另跑机器指标(句长 变异系数/套话密度/对话占比/章长轨迹/碎句指纹)与 16 本真人网文基线并排对账。
引用本 skill 结论时,按下面三层分清证据成色:
- (a) 机器验证成立的(可当硬证据引用):纪律词表把套话压到 0.00(机器计数, 「禁令管用」的硬证据,但只管到词表层);语料对词汇/物象/话术层的贡献(与语料原文 并排对读可证,证据形态不是评委评语);防抄袭红线可执行(6 部语料组作品 64,265 个 15 字滑窗 0 命中);垫底两部的行级实锤(整段逐字重复、写作术语泄漏、「带着一丝」 ×101、章长末/首比 0.42——grep 级取证,独立于任何审美判断)。
- (b) 被人工复核推翻/降级的(只能表述为「LLM 评委偏好」,不得当工序有效性证据): 「融合+纪律全场第一」「最像真人连载专项得主」「方法轴组合跨两档」「Opus 5 文学质地 天花板」——全部依赖四位 LLM 评委的审美共识,而该共识经复核与可测标准方向相反: 评委把碎句指纹离真人书最远的稿子捧上头名,把八部里唯一叙述指纹全线落在真人区间内的 稿子全票骂文风倒二。四评委互相独立却一致喜欢碎句腔,与我们此前双盲实验「评委间一致 率 86% 却一致地错」同构。
- (c) 本实验最重要的教训:碎句文艺腔是模型自带笔癖,语料仿写改不动句子形状——
零语料裸写稿写出与融合稿同款碎句腔、指纹同档。要管住句子形状,只有显式禁令(§5.5)
- 指纹验收(§5.6)。「读真书」的可辩护收益收缩为:词汇/物象/话术层 + 防抄袭意义上 的风格化安全。
- 诚实局限(引用结论时须知):每组单样本 n=1;经复核后仍站得住的硬结论只有 「纯语料无增益(复核后被加强)」「垫底两部行级实锤」「纪律词表压制机器验证」「碎句腔 模型自带」四条;「融合+纪律最优」不再是硬结论,方法轴头部座次待人类盲测收口;实验为 单命题中文长篇,对其他语域/语言的外推有限。
实战踩坑欢迎回写本文件(PR):新的裁决实例、模型新雷区、笔记模板改进,附上可复核的证据。
What ships with it: 1 file
29.9 KB alongside SKILL.md
- SKILL.en.md29.9 KB