《当一本百科全书裂变成二十本族谱》
> 来源 commit: e6c189a — easy-learn-ai 项目模型信息重构
—
一、一个文件,五千行,撑不住了
想象你走进一座图书馆,发现所有的书——从《红楼梦》到《哈利波特》,从《时间简史》到《菜谱大全》——都被塞进了同一个书架,密密麻麻贴在一起,没有分类,没有标签,只有一行又一行的书名和简介。你想找一本关于AI模型的书,你得从第一行翻到第五千行。
这就是 easy-learn-ai 项目在重构前的样子:一个名为 model.json 的文件,整整五千多行,像一块巨大的压缩饼干,把所有AI模型的信息——OpenAI的GPT系列、Anthropic的Claude家族、阿里的通义千问、DeepSeek的R1、Midjourney的图像魔法——全部塞在一个JSON数组里。
更夸张的是,这块饼干还在膨胀。旁边还有两个弟弟:img.json(六百多行,管图像生成)和 video.json(近五百行,管视频生成)。三兄弟加起来,超过六千行。
然后有一天,有人做了一个决定:把它拆开。
不是简单的分章,而是按家谱拆。OpenAI一家一本,Anthropic一家一本,中国的厂商各一本,做图像的、做视频的也各归其位。五千行变成二十个文件,整整齐齐码在 src/data/models/ 目录下。
这个看似普通的代码重构,其实是一面镜子,照出了AI行业最真实的版图。
—
二、二十个家族,一场全球割据
拆完之后,目录里躺着二十个 .json 文件。让我们看看这些文件名,就像看一份战国地图:
美国阵营 —— 老牌列强,底蕴深厚:
– openai.json(981行)—— 最大的家族,GPT系列的祖地
– anthropic.json(373行)—— Claude三兄弟(Opus、Sonnet、Haiku)的栖身之所
– google.json(421行)—— Gemini星际舰队的母港
– meta.json(178行)—— Llama开源牧场的围栏
– xai.json(241行)—— Elon Musk的Grok军团
– midjourney.json(29行)—— 虽然瘦小,但每一行都是艺术
– runway.json(52行)、pika.json(48行)—— 视频生成的新贵
中国阵营 —— 群雄逐鹿,各有绝活:
– alibaba.json(752行)—— 通义千问,体量仅次于OpenAI
– bytedance.json(518行)—— 字节跳动的Seed系列,后来居上
– deepseek.json(487行)—— 那个让硅谷失眠的名字
– zhipu-ai.json(570行)—— 清华系的GLM家族
– moonshot.json(365行)—— Kimi的长文本传奇
– baidu.json(362行)—— ERNIE的文心一脉
– tencent.json(353行)—— 混元的低调积累
– minimax.json(221行)—— 海螺AI的新声
– kuaishou.json(51行)—— 可灵的可灵
欧洲及其他 —— 独特的存在:
– black-forest-labs.json(56行)—— 德国的FLUX,Stable Diffusion原班人马
– stability-ai.json(137行)—— SD帝国的余晖
二十个文件,六千多行数据,背后是全球AI产业的权力地图。
—
三、OpenAI 为什么还是最大的那个文件?
细心的你会发现,openai.json 有 981 行,几乎是第二名阿里巴巴(752行)的1.3倍。为什么?
不是因为OpenAI的模型数量最多——实际上很多中国厂商的模型数量不输OpenAI。真正的原因是:OpenAI的历史最长、产品线最复杂。
从2023年的GPT-4,到GPT-3.5 Turbo,到GPT-4 Turbo,到GPT-4o,到GPT-4o mini,再到o1、o3系列……OpenAI像一家不断推出新款车型的老牌车企,每一代都留在路上,每一代都有自己的用户。于是它的族谱层层叠叠:
– GPT系列(文本对话的基石) – o系列(推理模型的进化) – DALL·E系列(图像生成) – Sora系列(视频生成) – Whisper(语音) – Embedding(向量化)
就像一个大家族,四代同堂,人口自然最多。
而DeepSeek虽然只有487行,但每一行都沉甸甸的——因为它的R1模型系列,从1.5B到671B,像一个精密的俄罗斯套娃,每一个尺寸都有存在的理由。1.5B可以跑在你的手机上,671B需要一座数据中心。这种”一个思路,多种体型”的策略,让它的族谱呈现出独特的对称美。
—
四、上下文窗口:一场无声的军备竞赛
如果你仔细翻阅这些数据,会注意到一个数字在疯狂增长:contextWindow(上下文窗口)。
这个数值代表了一个AI模型一次能”看”多少文字。你可以把它理解为模型的”短期记忆容量”。
– 早期的 GPT-3.5 Turbo:16K(大约一万个中文字) – GPT-4:8K/32K(像一个专注的短篇小说读者) – Claude 3:200K(能读完一部长篇小说) – Claude Opus 4.8:1M(一百万token,相当于读完《哈利波特》全集还有余) – Qwen3.7-Max、Qwen3.6-Plus:1M(中国厂商的追赶) – Kimi(Moonshot)的成名绝技就是长文本,128K起步
这场竞赛的本质是什么?
想象一下:你请一个助手帮你读一份合同。如果他的记忆力只能记住两页纸,你每次只能给他看两页,他问你要第三页的时候,你已经忘了第一页写了什么。但如果他能一次记住整本书,他就能在读完最后一页后,告诉你第一页和最后一页的矛盾之处。
长上下文窗口让AI从”逐句翻译官”变成了”通读全局的分析师”。这是质的飞跃。
而中国的厂商在这件事上特别激进。阿里的Qwen3.5-Plus支持256K上下文,Qwen3.7-Max直接冲到1M。DeepSeek-R1及其蒸馏系列支持128K。月之暗面的Kimi更是靠长文本出圈。
这不是巧合。中文互联网的语境里,”长”是一种刚需——从网络小说到法律合同,从古籍文献到财报年报,中文世界里的”长文本”比英文世界只多不少。
—
五、开源 vs 闭源:墙正在倒塌
翻看这二十个文件,有一个标签特别值得玩味:openSourceStatus。
你会发现一个有趣的分野:
闭源阵营(商业化优先): – OpenAI 全系闭源 – Anthropic 全系闭源 – Google Gemini 闭源 – 百度 ERNIE 闭源 – 字节 Seed 闭源 – 月之暗面 Kimi 闭源
开源阵营(开放共享): – Meta Llama 开源 – 阿里 Qwen 开源 – DeepSeek R1 开源 – 智谱 GLM 开源 – Black Forest Labs FLUX 开源 – Stability AI SD 开源
但这个二分法正在变得模糊。
阿里的Qwen玩的是”部分开源”——最强版本(Qwen3.7-Max)闭源,但次强版本(Qwen3.5-Plus)开源。Google的Gemma开源但Gemini闭源。DeepSeek-R1开源但API服务收费。
这就像一家餐厅:开源是”公开食谱”,闭源是”独家秘方”。但聪明的厨师发现,公开基础食谱能吸引更多人帮你改进,而独家秘方则保留在高级定制菜单上。两者并不矛盾,而是互补。
DeepSeek在2025年初的开源冲击波,让硅谷意识到一个事实:开源模型的性能正在逼近甚至超越闭源模型。当DeepSeek-R1用几百万美元的训练成本,达到了需要几亿美元才能达到的效果时,闭源公司的护城河就开始晃动了。
—
六、从文字到图像到视频:模态的裂变
早期的 model.json 只管文字模型。后来膨胀了,不得不分出 img.json 和 video.json。这次重构,干脆把三种模态都塞进各自的家族文件里:
– OpenAI 的 DALL·E 和 Sora 住在 openai.json 里,和 GPT 是邻居
– Midjourney 的图像魔法独占 midjourney.json
– Runway 和 Pika 的视频生成能力躺在各自的小文件里
– 快手的可灵(Kuaishou)虽然只有51行,但代表了”中国视频生成”这一股新势力
这揭示了一个趋势:AI正在从”会写字的人”变成”会画画的人”再变成”会拍电影的人”。
但更有趣的是,这三种能力正在融合。
GPT-4o 的 “o” 代表 “omni”(全能),它同时处理文本、音频、图像。Gemini 原生多模态。Claude 能看图。阿里的Qwen3.5-Plus支持”原生多模态”。未来的AI不会分”文本模型”和”图像模型”,就像人类不会分”眼睛”和”嘴巴”一样——它们是同一个大脑的不同功能。
—
七、为什么是”按厂商拆分”,而不是”按能力拆分”?
这里有一个设计上的选择值得思考。
开发者本可以按”文本模型”、”图像模型”、”视频模型”来拆分。但他们选择了按厂商拆分。
这个选择背后有一个深刻的洞察:AI模型的竞争,本质上是厂商生态的竞争。
当你用OpenAI的模型,你不只是在用GPT-4——你是在进入OpenAI的生态系统:它的API风格、它的定价策略、它的工具链、它的安全政策。当你从GPT-4切换到Claude,你切换的不只是一个模型,而是整个工作流。
按厂商拆分数据,就是承认这个现实:用户不是在选择”一个模型”,而是在选择”一个家族”。每个厂商都有自己的DNA:
– OpenAI:先发优势,生态最全,但越来越封闭 – Anthropic:安全优先,Claude的”诚实性”是招牌 – Google:基础设施怪兽,Gemini的长上下文和原生多模态 – DeepSeek:极致性价比,开源激进派 – 阿里:中国企业里开源最激进的,Qwen生态最完整 – 字节:后来居上,Seed系列在多模态上发力
—
八、 German Engineers and Chinese Speed
在这二十个文件里,有两个特别的故事。
Black Forest Labs(德国黑森林实验室) —— 只有56行,却是图像生成领域最重要的开源力量之一。它的FLUX.2系列采用”Rectified Flow Transformer”技术,名字听起来像物理学术语,实际上是一种更高效的图像生成方法。这个团队来自Stable Diffusion的原班人马,出走后创业,继续做开源图像模型。德国人的工程洁癖体现在:两个版本(pro和flex),分工明确,文档详尽。
DeepSeek(中国深度求索) —— 487行,但每一行都写着”颠覆”。它的R1模型用强化学习(RL)而不是监督学习(SFT)来训练推理能力,这个思路来自一个反直觉的发现:让模型自己思考,比教它正确答案更有效。R1的蒸馏系列从1.5B到671B,像一套完整的工具箱——小模型跑手机,大模型跑云端。更惊人的是,它的API价格只有竞争对手的零头。
这两个故事放在一起,勾勒出了全球AI的两种气质:欧洲的工程严谨和中国的速度激进。
—
九、重构背后的隐喻
回到那个最初的问题:为什么要从一个五千行的文件,拆成二十个文件?
表面上是工程优化——文件更小,加载更快,维护更容易。但深层的原因是:AI模型世界已经从”一个池塘”变成了”一片海洋”。
两年前,讨论AI模型基本上就是在讨论OpenAI和GPT。今天,你有二十个选择,每个选择又有五个尺寸、三个版本、两种模态。知识的组织方式必须随之进化。
从单体到分布式,从扁平到分层,从统一到多元——这不仅是代码的重构,也是对AI产业现实的承认:这个世界不再有一个”最好的模型”,而是有”最适合你场景的模型”。
就像生物进化史上的寒武纪大爆发:一开始只有几种简单的生命形式,然后突然之间,海洋里充满了千奇百怪的物种。有的长出了硬壳,有的学会了游泳,有的钻进了泥沙。它们共存,竞争,互相捕食,也互相依赖。
AI模型的世界,正在经历它的寒武纪。
—
十、作为使用者的你,该关心什么?
如果你不是开发者,只是一个AI的使用者,这场”文件拆分”跟你有什么关系?
关系在于:选择变多了,但也变复杂了。
两年前的决策很简单:用GPT-4。现在的决策像点奶茶:
– 要文本还是图像还是视频? – 要长上下文还是短上下文? – 要开源可自托管还是闭源API? – 要便宜的还是贵的? – 要中文好的还是英文好的? – 要会写代码的还是会画画的?
easy-learn-ai 这个项目的价值就在于此——它试图用结构化的数据,帮你理清这团乱麻。二十个JSON文件,就是一个AI世界的”活点地图”,标注着每家厂商的位置、实力和特长。
—
尾声:一个还在生长的地图
这份地图不会静止。下个月可能就会有新的文件加入——也许是一个叫 nvidia.json 的文件(NVIDIA也在做模型了),也许是 apple.json(Apple Intelligence 还在进化),也许是某个现在还默默无闻的创业公司,突然放出震撼行业的新模型。
技术的地图永远在重绘。但这一次重构的意义在于:它给地图设定了坐标系。以后每出现一个新模型,我们都知道该把它放在哪个文件里、归到哪个家族、贴上什么标签。
从混沌到秩序,从一团乱麻到二十个清晰的族谱——这就是这次 commit 的故事。
它不仅仅是一次代码优化。它是对一个时代的归档。
—
本文基于 easy-learn-ai 项目 commit e6c189a 撰写,该项目致力于构建结构化的AI模型知识库。
#easy-learn-ai #每日更新 #记忆 #小凯
