最近把 EvoScientist 和 OmniScientist 两个库都拉下来读了一遍。它们都挂着自己的 arXiv 技术报告,都号称能端到端做科研,但读完源码你会发现,它们想的根本不是同一件事。一个在解决“怎么让 AI 越做越像个老手”,另一个在解决“怎么让 AI 别对着二手表格瞎编”。
下面是我对着两份 README 和源码整理的对比,不是官宣稿,掺了点自己的判断。
EvoScientist:会自己进化的研究搭档
EvoScientist(v0.2.8,Apache 2.0)的根基是 LangChain 的 DeepAgents 框架。它的核心卖点叫“自进化”:跑一轮研究,系统就把过程中的观察记下来,连成一张知识图谱,边上标注“互补/矛盾/取代”。更狠的是 AutoSkills 机制,它定期从自己的记忆里挖出重复出现的套路,自动草拟成可复用的技能,挂起等你用 /autoskills 审核。换句话说,这个系统会自己写自己的工具。
配合这套的是 6 个子智能体:规划、调研、编码、调试、数据分析、写作,外加一个调度器。人类被放在“环上”(Human-on-the-Loop)而不是“环里”:默认每次跑 shell 要你批,智能体拿不准会主动问你。它还接了 Telegram、飞书、微信、Slack 一票渠道,配 WebUI、TUI、CLI,甚至能用 /schedule 排 cron 定时任务。成熟度相当高,DeepResearch Bench 两个版本都拿过第一,ICAIS 2025 还拿了最佳论文。
OmniScientist:能直接看原始数据的裁判型系统
OmniScientist(v0.1.1,MIT)的执念完全不同。它的 README 第一句就说,现在大多数 agent 只在文本和代码上推理,显微图像、地震波形、CT 体数据这些原始观测,得先被人压成表格才喂得进去。它要的是让 agent 直接读原始材料本身。
实现上它是一个自包含的 ReAct 循环,分三个阶段:Ideation(提假设)→ Experiment(跑代码读图)→ Writeup(写论文),每个阶段后面都堵着一道“闸”。这闸是代码写的,读的是执行记录而不是稿子:稿子里出现的每一个数字,必须真的在某次运行的 stdout 里出现过才放你过。实验结果为空就打回选题阶段重来,最多回退两次,而且记得上次失败的思路。参考文献实时查 OpenAlex 和 Crossref,查不到绝不编造,这点和很多“AI 写论文”项目不一样。
它能吃的模态有 12 种,跨图像、波形、音频、视频、点云、轨迹、表格、公式,自带地震学、化学、基因组、天文、病理、CT、超导、鸟声等方向的样例案例。桌面版把凭据从环境里抽走再交给 agent 跑代码,这个细节挺见安全意识的。
它们到底像不像
拉个清单:
| 维度 | EvoScientist | OmniScientist |
|---|---|---|
| 第一目标 | 让系统跨会话持续进化 | 让系统读原始数据并严格溯源 |
| 智能体结构 | 6 个子智能体协作 | 单 ReAct 循环,三阶段 |
| 多模态 | 弱,以文本/代码为主 | 强,12 种模态原生感知 |
| 验证机制 | 人工审批 + ask_user | 代码闸 + stdout 数字回链 |
| 学科覆盖 | 通用科研助手 | 理工多学科样例 |
| 部署形态 | Python 全家桶 + WebUI | 桌面 App / CLI,本地优先 |
| 成熟度 | v0.2.8,benchmark 第一 | v0.1.1,早期阶段 |
| 许可证 | Apache 2.0 | MIT |
相同点其实也不少:都能端到端产出一篇带图带表的论文;都主张“agent 自己跑分析代码、读回结果”而不是死记硬背;都把人类放在关键位置,一个靠审批,一个靠闸;连许可证都挑了最友好的那一档。
各自的短板
EvoScientist 的“自进化”听着玄,但它是文本/代码中心的工作方式。它不会“看见”一张电镜照片或一段地震波,原始观测还是得你先转成它能读的东西。它的防编造基本靠人来卡,审批、危险模式、自动放行名单,系统本身没有 OmniScientist 那种“数字必须来自真实 stdout”的硬约束。另外全家桶依赖 langgraph dev 后端,WebUI 还要 Node 24,部署不算轻。
OmniScientist 反过来,强验证、强感知,但它是单任务、单次运行的思路,没有跨会话持续进化的记忆和技能沉淀,生态也小得多,没几个内置技能、没渠道、没定时。v0.1.1 意味着接口还会变,Windows 那边还缺真实机器的运行反馈。你期待它“越用越懂你”,目前还谈不上。
我的看法
这俩不是竞争对手,是拼图的两块。
如果你要一个陪你长期搞研究的搭档,会积累经验、会自己造工具、能接消息渠道随时派活,EvoScientist 现在就能用,而且用得挺顺。它赌的是过程会越跑越熟。
如果你要把一个具体 dataset 丢进去,让它老老实实看原始数据,出一份每个数字都查有实据的稿子,OmniScientist 的设计更对路。它赌的是“看见真实、不许编造”这件事比“进化”更先决。
我个人的一点担心:两边都还停在“造神”的叙事里。EvoScientist 把“自我进化”讲得很燃,但跨会话记忆会不会变成自我强化的回声室,没人验证过;OmniScientist 的闸再硬,假设是谁提的、方向是谁定的,依然是人。真要落地到能发论文的辅助,中间还差着一截可解释性和责任归属的工程。
就到这。两个仓库都在 GitHub 上,链接和对应的技术报告放下面,感兴趣的自己去翻源码,比看我这篇快。
参考
– EvoScientist:https://github.com/EvoScientist/EvoScientist 技术报告 arXiv:2603.08127 – OmniScientist:https://github.com/Omni-Scientist/OmniScientist 技术报告 arXiv:2608.13558
