Redis 之父的新玩具:antirez 的 DwarfStar 刻意狭窄的推理引擎
做过 Redis 的人,下一个项目会做什么?
Salvatore Sanfilippo(antirez)的回答是:DwarfStar(ds4),一个刻意狭窄的本地推理引擎。GitHub Trending +385⭐/天,看起来不起眼,但这是 Redis 之父二十年后给出的新答案。
Redis 哲学的延续
Redis 的成功哲学是”做一件事做到极致”——不是做一个什么都能干的数据库,而是做一个内存缓存做到最快。二十年后,antirez 把这个哲学搬到了推理引擎赛道:
> DwarfStar is self-contained and deliberately narrow, not a general GGUF runner.
刻意狭窄,不是通用 GGUF 运行器。ds4 只支持三个模型:DeepSeek V4 Flash、GLM 5.2 和 DeepSeek V4 PRO。但把这三个模型跑到极致。
为什么不直接用 vLLM 或 llama.cpp?
本地推理引擎赛道已经拥挤。antirez 的回答是:通用 GGUF 运行器为了支持所有模型,做了太多妥协。vLLM 甚至不再支持老一代显卡(Ada Lovelace 架构),这让大量企业手里的 L40S 卡变成了废铁。
ds4 的机会主义策略是:跟随最好的开源权重,只跑这几个模型,但跑得最快最好。模型可以被替换——当更好的开源权重出现时,旧模型可以被换掉。
技术亮点
后端
– Metal:Mac 96GB+ 的主目标平台,更小的机器用 SSD streaming – NVIDIA CUDA:包括多卡系统和 DGX Spark – ROCm:Strix Halo 系统(如 Framework Desktop)
实测性能
8xL40S NVIDIA 卡多用户会话测试: – 120 t/s 聚合生成速度 – 2000 t/s prefill
这把”vLLM 不再支持的老卡”变成了多用户 LLM 服务器。对企业来说,这可能是 ds4 最实用的卖点——手里的旧 GPU 不用扔。
其他特性
– SSD streaming:RAM 不够就用 SSD 流式加载,MacBook 也能跑 – Tensor parallelism:两台 MacBook M5 Max / M3 Ultra 通过 RDMA 跑 4-bit DeepSeek Flash 或 GLM 5.2 – Pipeline parallelism:多系统串联,叠加 RAM 跑更大模型 – Micro batching:解码和生成分开批处理
自包含
模型加载、prompt 渲染、工具调用、KV state、HTTP server、coding agent——全部一起构建和测试。不是组件拼装,是一体化工程。
AI 协作开发的坦诚声明
ds4 的 README 里有一段罕见的坦诚声明:
> This software is developed with strong assistance from GPT 5.5, 5.6, Claude Fable and with humans leading the ideas, testing, and debugging. We say this openly because it shaped how the project was built. If you are not happy with AI-developed code, this software is not for you.
antirez 没有把 AI 辅助藏起来,而是公开承认它塑造了项目。人类主导想法、测试、调试,AI 主导代码生成。这是一个新的工程范式——人类架构师 + AI 程序员。
致谢 llama.cpp
ds4 不链接 GGML,但 README 明确说:
> This project would not exist without llama.cpp and GGML.
某些源码级片段(GGUF 量化布局、CPU quant/dot 逻辑、特定 kernels)在 MIT 许可下保留或改编。antirez 甚至把 GGML 作者的版权声明保留在 LICENSE 文件里。
这是开源社区的理想互动——站在前人肩膀上,公开致谢,保留版权。不是 fork,是致敬式的独立实现。
工程洞察:刻意狭窄的胜利
ds4 的设计哲学和近期一系列工作形成共鸣:
– colibrì(1300 行 C 代码跑 7440 亿参数):小而精的 C 代码在 AI 基础设施里依然有位置 – Euclid-MCP(推理外包):不是让一个通用系统做所有事,而是让专门工具做专门的事 – vLLM 弃老卡:通用系统的妥协就是专用系统的机会
这些工作共同指向一个主题:在”更大更强”的 AI 叙事里,”刻意狭窄”是被低估的策略。
类比
– 通用 GGUF 运行器 = 瑞士军刀,什么都能干但什么都不精 – ds4 = 专用手术刀,只切一种刀但切得最准 – Redis 当年 = 内存缓存做到最快,不碰 OLTP – ds4 现在 = DeepSeek Flash 做到最快,不碰其他模型
概念谱系:分工比统一更有效
ds4 归入”分工比统一更有效”概念谱系——不追求一个推理引擎跑所有模型,而是让专门引擎跑专门模型。和章鱼 DNA 预训练 + RNA 推理时计算、Euclid-MCP 的 LLM + Prolog 分工、Rebucca 的小模型 + 大模型复核是同一个家族的思路。
结语
antirez 选了一条和主流相反的路。在”支持更多模型、更大参数”的推理引擎军备竞赛里,ds4 的答案是”支持更少模型、跑得更快”。Redis 证明了”刻意狭窄”在数据库领域是赢的策略,ds4 在试它在推理引擎领域是否也成立。
如果成功,它不只是给世界多了一个推理引擎,而是给 AI 基础设施赛道提供了一个反直觉的范本——在通用化的时代,刻意狭窄可能是被低估的竞争力。
—
项目地址:https://github.com/antirez/ds4 作者:Salvatore Sanfilippo(antirez,Redis 作者) 许可:MIT 后端:Metal / CUDA / ROCm
