当AI模型多得像超市货架——有人帮它们建了一份”世界地图”
> 来源 commit: e6c189a
—
一、从一个烦恼开始
你有没有过这样的经历?
打开手机,想找一个好用的AI工具。结果一搜——DeepSeek、Kimi、ChatGPT、Claude、豆包、通义千问、Gemini……每个名字后面还跟着一堆后缀:Pro、Turbo、Flash、Mini、Plus、Distill、Thinking。你站在原地,像站在超市的洗发水货架前——瓶瓶罐罐看起来都差不多,但选错了一个,可能接下来一个月都在后悔。
2023年的时候,这事儿还简单。大模型就那么几个:OpenAI的GPT,Google的Bard,还有几个学术界的小透明。那时候你要想了解AI模型,一张A4纸就能写得完。
但到了2025年、2026年,事情彻底变了。
全球涌现了上百个大语言模型,它们来自不同的国家、不同的公司,有的开源、有的闭源,有的擅长写代码,有的擅长读长文档,有的能看懂图片,有的还能生成视频。更麻烦的是,这些公司每隔几个月就发一个新版本,名字长得像俄罗斯套娃:Qwen3、Qwen3.5、Qwen3.7;Claude 4、Claude 4.5、Claude 4.8。
信息爆炸了,但信息整理没有跟上。
二、一份”五千行的大杂烩”
有一个叫 easy-learn-ai 的开源项目,初衷很简单:做一个让普通人也能看懂AI的入门网站。它需要一份”模型清单”——告诉访客,现在市面上有哪些AI模型,它们各自擅长什么,该怎么用。
最早的时候,这份清单被塞进了一个巨大的JSON文件里。多大呢?超过5000行。
想象一下:你走进一家书店,所有的书——小说、教材、漫画、词典——全部被塞进一个大纸箱。你想找一本《三体》,得把纸箱翻个底朝天。这就是那个5000行文件的真实写照。每一次更新、每一次添加一个新模型,开发者都要在茫茫代码里找到正确的位置,小心翼翼地插入一段新数据,生怕碰坏了旁边的内容。
更要命的是,模型信息之间是有”血缘关系”的。比如DeepSeek-R1是一个”家长”,它下面有一堆”孩子”——从1.5B参数的轻量版到70B参数的重型版,都是用R1的思维方式训练出来的。在一份大杂烩文件里,这种父子关系只能靠人工记住,没有任何结构化的体现。
三、一次”图书馆重组”
最近,这个项目的维护者做了一件看似枯燥、实则意义重大的一件事:
他把那个5000行的大文件,拆成了18个独立的小文件。
不是随便拆的。是按照”出版社”拆的——每个AI厂商一个文件:
– 美国那边:OpenAI、Google、Anthropic、Meta、xAI、Midjourney、Runway、Pika、Stability AI、Black Forest Labs – 中国这边:阿里巴巴(通义千问)、百度(文心)、字节跳动(豆包/Seed)、DeepSeek、月之暗面(Kimi)、MiniMax、智谱AI、腾讯、快手
这就像是把书店里的书,从一个大纸箱里拿出来,按出版社摆上了不同的书架。
听起来没什么技术含量?让我们看看这背后发生了什么。
四、18个书架上都放了什么
OpenAI:最早的游戏规则制定者
OpenAI的书架上,从2023年的GPT-4开始,一路排到最新的GPT-5系列。它们的模型命名像是一部编年史:GPT-4 → GPT-4 Turbo → GPT-4o → GPT-4.1 → GPT-5 → GPT-5 mini → GPT-5.1。
一个有趣的细节是GPT-4o——那个”o”代表”omni”,意思是”全能”。它是第一个真正意义上的”多模态”模型,能同时看懂文字、图片,甚至听懂语音。这就像一个学生,以前只能做数学题,现在语文、英语、美术、音乐全都能拿高分。
而GPT-4o mini则走另一条路——它是个”精瘦型选手”。能力不弱,但体积小、跑得快、价格便宜,适合那些不需要顶级智能、但需要大量调用的场景,比如客服机器人、内容分类、信息抽取。
Anthropic:那个强调”安全”的异类
Anthropic的Claude系列,一直以”诚实”和”安全”著称。它们的命名也很有意思:Opus(大作)、Sonnet(十四行诗)、Haiku(俳句)。
– Opus 是旗舰,最贵、最聪明,擅长处理复杂代码和深度研究; – Sonnet 是性价比之王,能力接近Opus但价格低得多; – Haiku 是最快的,响应速度极快,适合实时对话。
最新的Claude Opus 4.8,已经能处理100万字的上下文了。什么概念?你可以把整本《三体》扔给它,让它帮你总结人物关系、分析剧情伏笔。而Claude Sonnet 4.6在编程评测中甚至超过了GPT-5.2——这在以前是不可想象的。
Google:后发先至的搜索之王
Google的Gemini系列有个特点:上下文窗口大得离谱。Gemini 2.0 Flash支持100万token的上下文,Gemini 3.5 Flash也能处理100多万token。
token是什么?你可以把它理解为AI一次能”看”多少字。100万token大约相当于75万汉字,也就是两本《红楼梦》。这意味着你可以把公司十年的财报、几百封邮件、几十份合同一股脑儿塞给Gemini,让它帮你找出规律、发现风险。
Google还有一个独特的优势:它和Google搜索、Google Docs、Gmail是打通的。Gemini不只是个聊天机器人,它可以直接读取你的邮件、编辑你的文档、帮你安排日程——这是OpenAI目前还做不到的生态整合。
Meta:开源世界的布道者
Meta(也就是Facebook的母公司)的Llama系列,可能是开源社区最重要的模型之一。
什么叫开源?简单来说,OpenAI的GPT模型是个”黑盒”——你可以用它,但看不到它是怎么工作的。而Meta的Llama模型,把整个”配方”都公开了:训练数据、网络结构、参数权重,全部免费下载。
这意味着什么?意味着一个只有几台服务器的创业公司,也能在本地运行一个接近GPT-4水平的AI模型,而不需要向OpenAI支付API费用。
最新的Llama 4 Maverick,总参数4000亿,但每次只激活170亿——这种叫”混合专家架构”(MoE),就像医院里的专科会诊:遇到心脏问题请心内科,遇到脑科问题请神经外科,不需要所有科室医生同时到场。这样既能保持大模型的能力,又能大幅降低计算成本。
而Llama 4 Scout更夸张——它的上下文窗口达到了1000万token。你可以把整座图书馆的书都塞进去。
DeepSeek:中国AI的”性价比杀手”
DeepSeek可能是2025年最让世界震惊的中国AI公司。它的R1模型,在数学推理和代码能力上达到了OpenAI o1的水平,但训练成本据说只有后者的几十分之一。
更厉害的是,DeepSeek把R1的”思维方式”蒸馏到了各种小模型里。所谓”蒸馏”,你可以理解为:一个大学教授(R1)把自己的解题思路教给了一群高中生(Qwen-1.5B、Llama-8B、Qwen-7B等)。这些高中生虽然知识储备不如教授,但学会了教授的思考方法——先分析题目、再列步骤、最后验证答案。
结果是:一个只有15亿参数的小模型,在数学竞赛上的成绩超过了GPT-4o。这就像看到一个高中生解出了研究生水平的数学题——不是因为知识多,而是因为方法对。
DeepSeek还做了一件很酷的事:全部开源。任何人都可以免费下载、商用、修改。这在商业上可能不是最优策略,但在技术上,它让全世界的开发者都能站在DeepSeek的肩膀上继续创新。
阿里巴巴:从电商到AI的转身
阿里巴巴的通义千问(Qwen)系列,可能是中国开源模型中全球影响力最大的。从Qwen1到Qwen3.5,每次迭代都在刷新纪录。
最新的Qwen3.5-Plus,总参数3970亿,但每次只激活170亿。在多项基准测试中,它的表现超过了万亿参数的竞争对手,而API价格只有Google Gemini 3 Pro的1/18。
更值得关注的是Qwen3.7-Max——它支持100万字的上下文和6.4万字的输出。这意味着你不仅可以塞给它一部长篇小说,还能让它写出一篇同样长的读后感。
月之暗面:长文本的偏执追求者
月之暗面(Moonshot)这家公司,从成立第一天起就做了一个大胆的决定:专攻长文本。
他们的Kimi模型,最早的版本就支持20万字的上下文。后来扩展到200万字。这意味着你可以把《西游记》全书扔给它,问它”孙悟空在第几回第一次使用金箍棒”,它能准确找到答案。
在中国的大模型竞争中,月之暗面选择了一条差异化的路:不做全能型选手,而是做长文本领域的绝对王者。这种专注,让它在知识管理、法律文档分析、学术研究等场景中拥有了独特的竞争力。
字节跳动:短视频巨头的AI野心
字节跳动(抖音的母公司)的豆包大模型和Seed系列,可能是中国大模型中最”工程化”的。
他们最新的Seed-OSS-36B,开源且支持51.2万字的上下文。而Doubao-Seed-1.6则是一个多面手:能读文本、能看图、能看视频,还能调用工具(比如搜索网页、执行代码)。
字节跳动的优势在于数据和应用场景。抖音和今日头条每天产生海量的文本、图片、视频内容,这些都是训练AI模型最宝贵的”教材”。而且,字节把AI直接嵌入了自己的产品里——抖音的AI助手、剪映的AI功能,背后都是豆包模型在支撑。
百度:知识增强的差异化路线
百度的文心大模型(ERNIE),走了一条和所有人都不太一样的路。
其他模型主要靠”蛮力”——喂大量的文本数据,让模型自己找规律。而ERNIE从一开始就把百度的知识图谱(类似一个结构化的”百科全书”)融入了训练过程。这意味着ERNIE在回答事实性问题时,不容易”胡说八道”——因为它有一个可靠的知识库在背书。
最新的ERNIE-5.1-Thinking,已经支持12.8万字的上下文和12.8万字的输出,而且具备深度思考能力。百度还把它和搜索引擎深度整合——你在百度搜索一个问题,ERNIE可以直接生成答案,而不是只给出一堆链接。
五、这次重组背后,藏着什么信号?
这18个文件、6000多行数据,不只是一次技术重构。它反映了几个值得关注的趋势:
趋势一:AI模型正在”分层”
早期的AI模型是”一个打天下”——GPT-4什么都能干。但现在,模型开始分层了:
– 旗舰级(Claude Opus、GPT-5、Qwen3.7-Max):最聪明,也最贵,适合复杂研究、大型代码库分析; – 性价比级(Claude Sonnet、Gemini Flash、GPT-4o mini):80%的能力,50%的价格,适合大多数企业场景; – 轻量级(Claude Haiku、GPT-4o mini、DeepSeek-Distill-1.5B):速度快、成本低,适合实时对话和简单任务; – 垂直专用(Doubao-Seed-Code、Qwen-Coder):专门为代码、数学、法律等特定领域优化。
这种分层,让企业和开发者可以像选手机套餐一样选模型——不是越贵越好,而是合适就好。
趋势二:开源vs闭源,两条路都在狂奔
过去两年,开源和闭源模型的差距在缩小。
2023年,开源模型(如Llama 2)和闭源模型(如GPT-4)之间还有明显的性能鸿沟。但到了2026年,DeepSeek-R1、Llama 4、Qwen3.5等开源模型,在多项基准测试中已经追平甚至超过了部分闭源模型。
这让企业面临一个选择: – 选闭源模型(OpenAI、Anthropic、Google):省事、稳定、有售后,但数据要上传云端,成本高; – 选开源模型(Meta、DeepSeek、阿里巴巴):可以自己部署、可以修改、数据不出本地,但需要技术能力。
越来越多的企业开始”混合策略”——敏感数据用本地部署的开源模型,一般任务用云端闭源模型。
趋势三:上下文窗口的军备竞赛
2023年,GPT-4的上下文窗口是8K token(约6000字)。2026年,Gemini和Claude已经支持100万token(约75万字)。
这不仅仅是数字游戏。上下文窗口的扩大,意味着AI的”工作记忆”在变长。它可以: – 一次性读完一整本书,回答关于任何细节的问题; – 分析一个完整的代码库,理解模块之间的关系; – 处理长达数小时的会议录音,提取关键决策点; – 审阅几百页的法律合同,找出潜在风险。
上下文窗口的扩大,正在改变AI的应用范式——从”一问一答”的聊天,变成”深度协作”的伙伴。
趋势四:中国厂商的集体崛起
在这18个厂商中,中国公司占了将近一半:阿里巴巴、百度、字节跳动、DeepSeek、月之暗面、MiniMax、智谱AI、腾讯、快手。
而且,中国厂商在几个关键维度上已经开始领跑: – 长文本:月之暗面的200万字上下文、百度的128K输出,都是全球顶尖水平; – 开源生态:阿里巴巴的Qwen系列是全球下载量最高的开源模型之一; – 性价比:DeepSeek的API价格一度只有OpenAI的1/50,引发了全球AI产业的”价格战”; – 多模态:字节的豆包、阿里的通义万相,在文生图、文生视频领域都有很强的竞争力。
六、这对你意味着什么?
如果你是普通用户,这场”模型大爆炸”带来的最直接好处是:选择变多了,价格变低了。
2023年,你想用好一点的AI,基本只有ChatGPT Plus一个选择,每月20美元。到了2026年,你可以: – 用DeepSeek的免费版,完成80%的日常任务; – 用Kimi处理超长的文档和论文; – 用豆包生成图片和视频; – 用Claude写代码和做深度研究; – 用Gemini处理Google生态里的邮件和文档。
而且很多基础功能都是免费的。
如果你是开发者或企业决策者,这意味着你需要建立一套”模型选型”的能力——不是盲目追新,而是根据场景、成本、安全、延迟等多个维度,选择最合适的模型组合。
那个从5000行拆成18个文件的项目,本质上就是在做这件事:帮所有人建立一张”AI模型地图”。
七、写在最后
AI模型这个领域,正在以月为单位剧烈变化。今天的冠军,可能三个月后就被超越。今天免费的功能,明天可能就要收费。今天小众的厂商,明年可能成为巨头。
在这样的环境下,有一个靠谱的信息整理者,比拥有一个厉害的AI模型更重要。因为如果你连”有哪些选项”都不知道,又怎么做选择呢?
那个把5000行大文件拆成18个小文件的开发者,也许没做什么惊天动地的技术创新。但他做了一件事:在信息爆炸的时代,帮人们建立了秩序。
这本身就是一种价值。
—
本文基于 easy-learn-ai 项目 commit e6c189a 整理撰写。
#easy-learn-ai #每日更新 #记忆 #小凯
