8 本导演教材蒸馏成 98 个 AI 技能:我复跑了它的测试,也翻了它的 git 历史

从一条提交记录说起。 「fix(darwin): 批量添加 checkpoints 到 43 个 skill,...

从一条提交记录说起。

「fix(darwin): 批量添加 checkpoints 到 43 个 skill,修复 3 个 scene-transition 的 D2。」

2026 年 6 月 8 日凌晨,GitHub 上一个仓库在通宵改作业。这条提交的下文还有更直白的一句:「增强 10 个 skill 的 B 段反模式内容,提升 D3/D9 得分」。翻译成人话:为了让评分表上两项各涨一分,给 43 个文件批量塞进了检查点。

仓库叫 DirectorSkills,作者 geegl,38 颗星。它干的事一句话说完:把 8 部好莱坞影视教材,蒸馏成 98 个可被 AI agent 调用的技能文件。从初始化到收摊,33 个小时。

我把仓库通读了一遍,逐条过了提交历史,在本机复跑了它的全套测试。结论是三句话。单个技能的打磨水准出乎意料地高;「路由测试 659/659 全过」这块招牌有成色问题;版权声明和仓库实物对不上。三件事同时成立。

一、它是什么

每个技能一个目录,里面两样东西:一份 SKILL.md,一份配套测试。SKILL.md 走六段结构,行话叫 RIA-TV++:

装什么
R原文引用,≤150 字,带章节页码,可溯源到原书
I方法论骨架重写
A1书内实战案例 ≥2 个
A2触发场景 + 「语言信号」
E步骤 + 判停
B边界 + 失败模式 + 作者盲点

书目和产量:救猫咪 8 个、Mackendrick《电影导演大师课》15 个、Kenworthy《大师镜头》三卷 26 个、Katz《电影镜头设计》8 个、Blain Brown《电影摄影》7 个、Van Hurkman《调色师手册》11 个、Bays《大师场景》9 个、Sonnenschein《声音设计》13 个——97 个,外加 1 个跨书综合的镜头锚定库,共 98。63 万字符中文技能文本,从剧本到成片一条链。

抽查打分最高的那篇(「想好结尾再写开头」,出自 Mackendrick)。它连「探索性写作不适用此原则」「互动叙事会挑战闭合叙事」这种边界都写进去了。B 段的「作者盲点」是整份文件最见功力的地方——教 AI 用方法论,还教它这个方法论在哪会失灵。这个颗粒度,市面上的 prompt 库很少见。

二、流水线长什么样

提交历史把全流程留了痕:

graph LR A[“PDF 按四页一张切图”] –> B[“视觉模型转录”] B –> C[“Adler 整书理解”] C –> D[“五路并行提取候选”] D –> E{“三重验证”} E –>|通过| F[“RIA-TV++ 六段成稿”] E –>|淘汰| G[“rejected 带理由”] F –> H[“Zettelkasten 互链”] H –> I[“触发与反触发测试”] I –> J[“98 个技能入库”]

筛选是真筛。story-design 一册:72 个候选,31 个通过三重验证,最终只剩 8 个技能。淘汰理由写得有牙齿——「平方反比定律:初中物理知识」,拒;《上海小姐》的视角操纵——威尔斯的个人技法,难以复用,拒。常识和孤例进不了技能库,这层筛选不是走过场。

三、「100% 通过」的成色

这是全仓库最值得掰开的一处。

仓库里躺着两份打架的报告。一份旧的写着:659 条测试,总体通过率 56.9%,「该触发」用例只命中 33%,声音设计一册更是只命中 2%。根目录的 JSON 写着 659 条全过。README 引的是后者。

差距怎么抹平的?提交记录交代得清清楚楚:重写测试用例(原话叫「去模板化」),再给路由器加「书域隔离」。我读了路由器源码,「该触发」的及格线是目标技能进入本书内部的前三名。一本书平均不到 10 个技能,前三名的门槛相当宽。

我在本机把全套测试复跑了一遍:670/670,100%。数字能复现,没造假。可我拿旧报告里失败过的那条查询试了全局模式——「混录的时候对白被音效盖住了,怎么处理层次?」——正确的声音设计技能在全库排第三,前头站着两个不相干的导演技能。路由器没变聪明,变的是及格线。它的本质是关键词加 TF-IDF,真要用,得靠 Claude Code 这类 agent 的技能发现机制补位。

顺带说一句,「Darwin 审计平均 8.9 分」同理。对着评分维度定向修文,分数证明的是会迎合评分表,不完全是内容变好了。这有个名字,古德哈特定律。

四、版权这一页

README 声明:「本仓库仅包含蒸馏后的结构化 skills,不包含任何原始书籍内容。」

实物对不上,三处。其一,color-grading 目录下有个 193KB 的转录残留文件,通篇是《调色师手册》中文版的成段原文,带原文小节编号。其二,candidates 目录里大量整段引文,本身就是书的衍生内容。其三,早期提交给开发配置文件加过「PDF Google Drive 下载链接」,我核对了那个历史版本,网盘链接出现 7 次。文件后来删了,链接还留在公开的 git 历史里——链接本身我不在此复述。

作品是 MIT 的,书是别人的。这套操作属于「合规外观、边角泄漏」:正文确实干净了,工作文件没扫干净,历史更扫不掉。

五、它站在谁肩膀上

这个项目有两件上游工具,README 自己也承认:六段格式出自 cangjie-skill(仓颉),9,618 星的「内容蒸馏」头部项目;质量审计出自 darwin-skill,5,893 星的技能自动进化器。所以与其说这是发明,不如说这是一次执行力极强的下游应用——拿着现成的流水线,狠狠跑了一遍。

站里最近聊过好几个技能仓库,patent-disclosure-skill、taste-skill 那几篇都是。它们的共同点是:技能由人手写,写什么、怎么写,作者说了算。DirectorSkills 走的是另一条路:技能从书里长出来,一篇 300 页的教材进去,二十来个带测试的技能出来。这条「书 → 技能」的路子,值得单独看一眼。

六、作者给自己的生活开了个差评

最能泄露意图的是那个跨书技能。它不在讲导演,在讲怎么写 AI 视频的提示词:「写 IMAX 胶片加 Panavision C 系列 35mm f/4,比写『电影质感、史诗级』有效 10 倍」。整座技能库的终点,原来是 AI 生成视频。

更有意思的是续作。8 月底同一个作者开了新仓库 directormind,9 月 6 日还在提交。定位换了个光谱:证据驱动,规则要先过前向测试才能转正,私有项目实测但不发原文。第一阶段是「把书倒进模型」,第二阶段他开始怀疑倒进去的东西没经过验证。这个转向,本身就是对前一个项目最到位的批评。

七、值钱与不值钱

值钱三样。单个 SKILL.md 的颗粒度——A2 段的语言信号教会 agent 听懂人话什么时候该翻牌,E 段的判停条件、B 段的作者盲点,都是可偷师的设计。「非常识即淘汰」的验证品味。还有整条流水线的完整示范:拆书、验证、淘汰、互链、压测,每一步有产物、有淘汰率、可复跑。想搭自己的「知识 → agent 技能」管线,这是目前最完整的参照物之一。

不值钱三样。路由层是玩具;分数是刷出来的;98 个技能没有一个经过真实成片检验。它能告诉你「该用什么镜头」,没人替你确认「用了真的更好」。

当方法论范本收藏,值。当生产资料直接挂进 agent,先自己补检索和验证。

八、边界

三件事我没搞清楚。Darwin 的逐技能分数没有入库,「平均 8.9」无法独立核验。原文引用的中文来源——中译本还是模型代译——没有记录,我只抽查了一条。「9 维」还是「10 维」,仓库内部自己就不一致。

数据快照 2026-09-07。路由测试我本机复跑过,其余数字出自仓库文件与 GitHub API,星数为动态值。

参考:geegl/directorskills · kangarooking/cangjie-skill · alchaincyf/darwin-skill · geegl/directormind

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1