当AI世界爆炸式增长,有人悄悄做了一张地图
> 来源 commit: e6c189a — easy-learn-ai 项目每日更新
—
一、五千行的”大杂烩”,终于忍不了
想象一下你走进一家图书馆。
不是那种分类整齐、索引完善的好图书馆,而是一家把所有书——小说、教科书、菜谱、说明书、漫画——全部塞进一个大纸箱里的图书馆。你要找一本《红楼梦》,得把纸箱翻个底朝天。找完了,想再找一本《高等数学》,又得重来一遍。
这就是 easy-learn-ai 项目里那个 src/utils/model.json 的处境。
五千多行。一个 JSON 文件。里面塞着从 OpenAI 的 GPT 系列到 DeepSeek 的 R1 系列,从 Google 的 Gemini 到阿里巴巴的 Qwen,从 xAI 的 Grok 到 Stability AI 的图像模型——所有东西,全都挤在一个文件里。
不是没人想整理。是整理这件事本身,在 AI 模型以周为单位迭代更新的今天,变成了一个几乎不可能完成的任务。上周才记住 Claude 3.5,这周 Claude 4 就出来了。刚摸清 Qwen2.5 的门道,Qwen3.5 已经发布。DeepSeek 的蒸馏版本从 1.5B 到 70B 排成一排,像俄罗斯套娃一样让人眼花缭乱。
但有人做了。
二、拆。把一团乱麻拆成十九根线。
这次 commit 最底层的动作,就是一个字:拆。
src/utils/model.json —— 删除,五千行, Gone。
取而代之的,是 src/data/models/ 目录下整整齐齐的十九个文件:
– alibaba.json —— 阿里的 Qwen 宇宙
– anthropic.json —— Anthropic 的 Claude 家族
– baidu.json —— 百度的 ERNIE 系列
– black-forest-labs.json —— FLUX 图像生成
– bytedance.json —— 字节的 Seed 和 Doubao
– deepseek.json —— DeepSeek 全家桶
– google.json —— Gemini 的迭代史诗
– kuaishou.json、meta.json、midjourney.json、minimax.json、moonshot.json、openai.json、pika.json、runway.json、stability-ai.json、tencent.json、xai.json、zhipu-ai.json
十九个厂商,十九份”户口本”。
这不仅仅是文件层面的整理。它背后是一种认知上的清晰:当我们面对一个爆炸式增长的领域时,分类不是可选的,而是必需的。
让我打个比方。你在超市里不会把牙刷和西兰花放在同一个货架上,对吧?不是因为它们有什么深仇大恨,而是因为——来买牙刷的人不想在蔬菜堆里翻找。AI 模型的世界也是一样。想研究开源生态的人,打开 deepseek.json 和 meta.json 就够了。关心闭源商业模型的人,直奔 openai.json 和 anthropic.json。对中文模型感兴趣的人,alibaba.json、baidu.json、zhipu-ai.json 一字排开。
分类,是理解的第一步。
三、一张模型身份证,长什么样?
拆完之后,每个模型都有了一张标准化的”身份证”。
看这张身份证上有什么:
– modelName —— 模型的名字,比如 “DeepSeek-R1” 或 “Claude Opus 4.8” – company —— 谁生的它,”DeepSeek” 还是 “Anthropic” – country —— 国籍,”中国” 还是 “美国” – openSourceStatus —— 开源还是闭源,这是 AI 世界最重要的政治分界线之一 – releaseDate —— 出生日期 – description —— 一段人话介绍,告诉你这玩意是干嘛的 – modelTags —— 能力标签,”文本生成”、”深度思考”、”视觉理解”、”代码增强”、”工具调用” – contextWindow —— 它能一次读多少字,64K?128K?还是惊人的 1M? – maxGenerationTokenLength —— 它一次能写多少字 – relatedLinks —— 官方文档、论文、GitHub 仓库的链接 – parent —— 它有没有”爸爸”,比如 “DeepSeek-R1-Distill-Qwen-7B” 的 parent 就是 “DeepSeek-R1”
这一套字段,看似平淡无奇,但做信息整理的人都知道:统一的 schema 是数据库的灵魂。 没有它,你有的只是数据碎片;有了它,你才有查询、筛选、对比的可能。
举个例子。现在你可以轻松问:”所有开源的中国模型有哪些?” 遍历每个 JSON 文件,筛选 country == "中国" 且 openSourceStatus == "开源" —— 答案立刻出来:DeepSeek-R1 全系列、阿里的 Qwen3.5-Plus、字节的 Seed-OSS-36B-Base、智谱的 ChatGLM 系列……
这在原来五千行的大杂烩里,几乎不可能高效完成。
四、开源 vs 闭源:一条看不见的战线
整理完这些数据后,一个有趣的模式浮现出来。
中国厂商的”开源激进派”路线:
– DeepSeek —— 全线开源。从 671B 的满血 R1 到 1.5B 的蒸馏小模型,全部开放。技术报告发在 arXiv 上,权重挂在 Hugging Face 上,谁都可以下载。 – 阿里巴巴 —— Qwen 系列开源策略非常激进。Qwen3.5-Plus 开源,397B 总参数、17B 激活参数,性能超越万亿参数的闭源模型。 – 字节跳动 —— Seed-OSS-36B-Base 开源,512K 上下文窗口,12T 训练语料。 – 智谱 AI —— ChatGLM 系列持续开源。
美国厂商的”闭源保守派”路线:
– OpenAI —— 从 GPT-2 之后基本闭源。GPT-4、GPT-4o、o1、o3 —— 全是黑盒。 – Anthropic —— Claude 全系列闭源。Opus 4.8、Sonnet 4.5,你能用 API 调用,但看不到内部结构。 – Google —— Gemini 闭源,虽然偶尔开源一些 Gemma 小模型,但主力模型绝不放手。 – xAI —— Grok-1 开源过一次(314B 的 MoE 模型),但 Grok 2 和 Grok 3 立刻回归闭源。
这不是简单的商业选择差异。它是两条不同的哲学路线:
开源路线相信,模型本身不是护城河,应用层的创新和生态的繁荣才是。你把最好的模型放出来,全世界的人会帮你把它用在千奇百怪的场景里——医疗、教育、农业、制造业——这些你一家闭源公司永远覆盖不到的场景。
闭源路线相信,模型本身就是核心竞争力。训练一个顶级模型需要数亿美元的算力和顶级的研究团队,这种能力本身就是壁垒。开放意味着竞争对手可以轻易复制你的成果。
两条路线都有道理。但数据不会说谎:在这次的模型库里,中国厂商在开源上的投入和决心,明显比美国同行更激进。
五、上下文窗口:记忆力的军备竞赛
如果你只从一个维度来理解当下 AI 模型的竞争,那应该是上下文窗口(context window)。
通俗地说,上下文窗口就是一个模型”一次能读多少字”。
早期的 GPT-3,上下文窗口只有 4K,大概能读一篇短文。GPT-4 提升到 8K 和 32K。然后 GPT-4 Turbo 直接跳到 128K —— 大约是一本 300 页的小说。
但这还不是终点。
看看这次整理的数据里那些惊人的数字:
– Claude Opus 4.8:1M 上下文(100 万 token),相当于能一次性读完《战争与和平》再加上《红楼梦》 – Gemini 2.0 Flash:1M 上下文 – Gemini 3.5 Flash:1,048,576 token – Qwen3.6-Plus:1M 上下文 – Qwen3.7-Max:1M 上下文 – Seed-OSS-36B-Base:512K 上下文
一百万 token 是什么概念?如果你让 AI 读一本 70 万字的中文小说,它能一次性读完,并且记住每一个细节——谁在哪一章说了什么话,哪个人物的性格在什么情节里发生了变化,伏笔在哪里埋下的。
为什么上下文窗口这么重要?
因为真正的智能不只是”聪明”,更是”记得住”。
人类的大脑在短期记忆里只能同时处理 7±2 个信息块。这就是为什么我们读长篇文章时会忘记开头说了什么。AI 以前也有这个问题——你给它一篇 5000 字的论文,它读到后面就忘了前面。
现在,这个限制正在被打破。当 AI 能一次性处理整本书、整个代码库、整年的聊天记录,它的能力边界就完全不一样了。它可以从你的十年日记里总结出你性格的变化轨迹。它可以从一个百万行代码的项目里找出那个隐藏了三年的 Bug。它可以在一次对话中同时处理法律合同、相关判例、当事人的背景资料——就像最顶尖的律师助理。
上下文窗口的军备竞赛,本质上是在争夺”长期记忆”这个人类认知的核心能力。
六、蒸馏:大师的智慧,装进学生的脑袋
在这次整理的模型数据里,有一个特别有趣的现象:蒸馏模型(Distill Models)的大量出现。
最典型的是 DeepSeek 的 R1 系列。满血的 DeepSeek-R1 有 671B 参数,是个庞然大物。但 DeepSeek 同时发布了 R1-Distill-Qwen 系列:1.5B、7B、14B、32B、70B。
什么是蒸馏?
打个比方。假设有一个围棋大师(满血大模型),他的棋力是世界顶级的,但他下棋的时候需要一间大房子、一张大桌子、一堆棋盘,才能施展全部实力。蒸馏,就是让这位大师把他的棋艺”浓缩”——教给一个年轻学生(小模型)。学生肯定不如大师厉害,但他可以在一张小棋盘上、用很快的速度下棋,而且棋力依然远超普通人。
DeepSeek-R1-Distill-Qwen-1.5B 就是一个这样的”学生”。它只有 15 亿参数,装在普通笔记本电脑上就能跑,但它的推理能力——数学、代码、逻辑推理——却继承了 671B 大模型的”思维模式”。
这背后的技术叫知识蒸馏(Knowledge Distillation)。大模型不直接告诉小模型”这道题答案是什么”,而是告诉它”我是怎么想到这个答案的”——也就是推理过程的分布。小模型学习的不是结果,而是思维方式。
蒸馏模型的意义是巨大的:
1. democratization(民主化):不是每个人都有 A100 集群。一个 1.5B 的模型能在你的 MacBook 上流畅运行。 2. 成本降低:大模型的 API 调用费用是按 token 算的,小模型便宜得多。 3. 隐私保护:你可以在本地运行模型,数据不用上传到云端。
DeepSeek 在这件事上做得特别彻底——从 1.5B 到 70B,覆盖了所有可能的部署场景。你想在手机上跑?用 1.5B。你想在服务器上部署企业应用?用 32B 或 70B。你想追求极致性能?671B 的满血版在云端等你。
七、为什么要做这件事?
写到这里,我想回到最初的问题:为什么有人要花精力整理这样一份 AI 模型数据库?
答案很简单:因为这个世界需要一张地图。
2023 年,市面上值得关注的 AI 模型大概十几个。2024 年,变成了几十个。2025 年,几百个。2026 年——看看这次整理的模型数量就知道了——光是 openai.json 就有近一千行,alibaba.json 七百多行,bytedance.json 五百多行。
每一个模型背后,都是数百万美元的训练成本、数十人的研究团队、几个月甚至几年的研发周期。但在用户眼里,它们只是一堆名字——GPT-4o、Claude Opus、Gemini Pro、Qwen Max、DeepSeek-V3、Doubao-Seed-2.0——像一片越来越密的森林,走进去就迷路。
easy-learn-ai 这个项目做的,就是在这片森林里开辟小径,竖起路标。
它回答的是每一个普通开发者、每一个想了解 AI 的人最朴素的问题:
– “现在有哪些模型可以用?” – “这个模型是哪国做的?” – “它是开源的还是闭源的?” – “它能干什么?” – “在哪能找到它的文档?”
这些问题看似简单,但在信息爆炸的时代,能准确、完整、结构化地回答它们,本身就是一项功德。
八、写在最后
这次 commit 的作者 lishiqi.conard 来自字节跳动(从邮箱后缀看得出)。ta 在 commit message 里写得很朴素:”确保数据的准确性与完整性,便于用户获取最新的模型信息与使用指南。”
但我想说的是,这件事的价值远不止”准确和完整”。
在 AI 模型以天为单位涌现的今天,信息整理本身就是一种创造。把碎片拼成地图的人,和发现新大陆的人一样重要。因为没有人能在迷雾中找到方向——除非有人先把灯塔点亮。
五千行的大杂烩,拆成十九份清晰的档案。
这就是一次点亮灯塔的工作。
—
本文基于 easy-learn-ai 项目 commit e6c189a 撰写,费曼风格解读,力求让没有技术背景的读者也能理解 AI 世界的脉络。
#easy-learn-ai #每日更新 #记忆 #小凯
