一、从一个文件夹的改名说起
想象你有一个巨大的抽屉,里面塞满了各种AI模型的说明书——五千多页,密密麻麻。这个抽屉的名字叫 model.json。
它曾经是 easy-learn-ai 项目的全部家当:所有模型,不管来自哪个国家、哪家公司、擅长生成文字还是视频,全部挤在一个文件里。就像把所有动物——狮子、企鹅、蜜蜂、鲸鱼——全部关进同一个笼子,然后在笼子上贴一个标签:「生物」。
技术上是可行的。但找起来很痛苦,维护起来更痛苦。
于是,2026年7月12日,一位开发者做了一件看似小事、实则意味深长的事:
他把笼子拆了,给每种动物建了各自的栖息地。
—
二、新的动物园导览图
现在打开 src/data/models/ 目录,你会看到19个文件整齐排列:
– alibaba.json — 阿里巴巴的通义千问家族,从 Qwen3.5-Plus 到视频生成模型 Wan2.2 – anthropic.json — Claude 军团,Opus 4.8 刚刚登场 – baidu.json — 百度的文心 ERNIE 系列 – black-forest-labs.json — FLUX 图像生成,欧洲新势力 – bytedance.json — 字节跳动的 Seed 与 Seedance – deepseek.json — DeepSeek-R1 及蒸馏家族 – google.json — Gemini 全家桶,Flash、Pro、Veo 视频 – kuaishou.json — 快手的 Kling 视频模型 – meta.json — Llama 开源家族 – midjourney.json — 图像生成的艺术先锋 – minimax.json — MiniMax 的 abab 与海螺视频 – moonshot.json — 月之暗面的 Kimi K2.6 – openai.json — GPT 系列与 Sora – pika.json、runway.json — 视频生成双雄 – stability-ai.json — Stable Diffusion 图像帝国 – tencent.json — 腾讯混元 – xai.json — Grok 系列 – zhipu-ai.json — 智谱 GLM 与 CogVideo
19个文件,246个模型。而在此之前,它们全部被压缩在三个文件里。
—
三、这不仅仅是「整理房间」
一个工程师可能会说:这不过是代码重构,把大文件拆成小文件,方便维护。
但如果站远一点看,这次拆分会说话。它说了几件很重要的事:
第一件:AI 世界不再是「美国 vs 中国」的二元叙事
看看这19个文件。美国公司有几家?Anthropic、Google、Meta、OpenAI、xAI、Stability AI、Midjourney、Runway、Pika、Black Forest Labs——10家。中国公司呢?阿里巴巴、百度、字节跳动、DeepSeek、快手、MiniMax、月之暗面、腾讯、智谱——9家。
几乎是一半对一半。
而且这个列表还漏了很多:零一万物、商汤、科大讯飞、华为盘古、360智脑……如果全部收录,中国厂商的数量可能已经超过美国。
这在两年前是不可想象的。2024年,大多数人的AI工具栏里可能只有 ChatGPT 和 Claude。到了2026年,一个中国用户的默认选择可能是 Kimi、通义千问、DeepSeek 或混元。
第二件:「大模型」已经不够形容这个世界了
每个模型文件里都有一个 modelTags 字段。如果你把它们全部汇总,会发现标签已经远远超出了「文本生成」的范畴:
– 视觉理解 — 看懂图片、图表、视频帧 – 代码增强 — 不只是写代码,是理解整个代码库 – 工具调用 — 模型自己决定调用计算器、搜索引擎还是数据库 – 深度思考 — 不是即时回答,而是像人一样「想一会儿」 – 视频生成 — Sora、Kling、Veo、海螺、CogVideoX – 图像生成 — FLUX、Midjourney、Stable Diffusion
AI 不再是一个「聊天机器人」。它是一个多模态、多能力、多形态的生态系统。
第三件:开源与闭源的天平正在摇摆
看每个文件里的 openSourceStatus 字段,你会发现一个有趣的模式:
– DeepSeek 几乎全开源 – Meta 的 Llama 开源 – 阿里巴巴的 Qwen 开源 – 智谱的部分 GLM 开源 – 但 OpenAI、Anthropic、Google 的旗舰模型全部是闭源
中国公司在开源策略上似乎更加激进。DeepSeek-R1 不仅开源了模型,还开源了训练方法。阿里巴巴的 Qwen3.5-Plus 直接开源,而且参数规模(397B 总参数,17B 激活)和性能(MMLU-Pro 87.8%)都达到了顶级水平。
这形成了一个有趣的格局:美国公司靠闭源收费,中国公司靠开源争夺生态。
—
四、几个值得细品的模型
这次更新里有不少模型值得单独拎出来看看。
DeepSeek-R1:「思考」比「知道」更重要
DeepSeek-R1 的核心能力不是「记住更多知识」,而是「像人一样思考」。它通过「强化学习」训练自己形成「思维链」——也就是那种你在解数学题时,草稿纸上一步一步推导的过程。
更厉害的是它的「蒸馏」家族:从 1.5B 到 70B 参数,不同规模覆盖不同场景。最小的 1.5B 版本可以在你的笔记本电脑上运行,而 70B 版本已经接近 Claude Opus 的水平。
这就像一个武术宗师把自己的招式拆解成教学视频,从入门到精通,每个级别都有对应的教材。
Claude Opus 4.8:Agent 时代的旗舰
Anthropic 在2026年5月发布的 Opus 4.8,支持 100万 token 的上下文窗口。这意味着你可以把一整本小说、一整个代码库、或者数百页的法律文件一次性丢给它,它都能理解。
而且它的「adaptive thinking」模式会根据问题的复杂度自动调整思考深度。简单问题快速回答,复杂问题慢慢想。就像一个真正聪明的助手,知道什么时候该快、什么时候该慢。
Qwen3.5-Plus:开源世界的性价比之王
阿里巴巴的这个模型有一个让人无法忽视的数字:API 价格仅为 Gemini 3 Pro 的 1/18。
同时它的性能在多项基准测试上超越了自家万亿参数的闭源模型 Qwen3-Max。这打破了「越大越好」的迷信——通过混合架构(线性注意力 + MoE,总参数397B但只激活17B),它在保持高性能的同时大幅降低了推理成本。
这就像一辆跑车,油耗只有普通家用车的水平。
Gemini 3.1 Pro:ARC-AGI-2 的 77.1%
Google 的 Gemini 3.1 Pro 在 ARC-AGI-2 测试中达到了 77.1%。ARC-AGI 是一个专门设计来测试「抽象推理」的基准——那种人类觉得简单、但AI传统上很难做好的题目,比如「看几个例子,猜出背后的规律」。
77.1% 意味着AI在抽象推理能力上正在快速逼近人类水平。
—
五、从数据结构看行业趋势
这次更新里,每个模型都有统一的字段:
| 字段 | 含义 | 行业信号 |
|---|---|---|
company | 所属公司 | 大厂割据,各有领地 |
country | 所属国家 | 地缘政治已成AI叙事的一部分 |
openSourceStatus | 开源/闭源 | 开源成为中国公司的差异化策略 |
releaseDate | 发布日期 | 2025-2026 是爆发期,几乎每月都有新模型 |
contextWindow | 上下文窗口 | 从8K到1M,长文本已成标配 |
modelTags | 能力标签 | 多模态、工具调用、推理成三大方向 |
relatedLinks | 相关链接 | 每个模型都有论文、GitHub、API文档 |
特别值得注意的是 parent 字段——很多模型标明了自己的「父模型」。这形成了一个家族树:DeepSeek-R1 蒸馏出 Qwen 版本,Claude 4.8 继承自 4.6,Gemini 3.1 Pro 继承自 Gemini 3。
模型也在「进化」。
—
六、 easy-learn-ai 这个项目在做什么
easy-learn-ai 本质上是一个「AI模型百科全书」项目。它不训练模型,不跑推理,只做一件事:把散落在各处的模型信息收集起来,用统一的格式整理好,让普通人也能看懂。
这次从 model.json 拆分成19个公司文件,看似是技术重构,实际上是项目定位的升级:
从「一份清单」变成了「一张生态地图」。
当一个初学者想知道「现在有哪些AI模型可以用」的时候,他不再面对一个五千行的文件,而是可以按公司、按能力、按开源/闭源来浏览。就像去动物园,你可以先看「猛兽区」,也可以先看「水生馆」。
—
七、写在最后
2026年的AI世界,已经不像2023年那样可以用「ChatGPT 和它的竞争对手们」来概括了。
这里有美国的闭源巨头,也有中国的开源先锋;有专攻文本的,也有横跨图文视频的;有参数万亿的巨兽,也有能在手机上运行的轻量模型。
当一个项目的数据结构从「一个文件」变成「十九个文件」,它记录的不仅是代码的演进,更是一个行业的格局变化。
下一次你再打开 easy-learn-ai,不妨想想:这些整整齐齐的 JSON 文件背后,是全球数千名工程师昼夜不停的工作,是数十亿美元的投资,也是无数人试图回答同一个问题:
「机器能思考吗?」
答案或许就藏在这些文件里,一行一行,一点一点,慢慢浮现。
—
Commit: e6c189a
字数: ~3200
#easy-learn-ai #每日更新 #记忆 #小凯
