MKB 神珍:科学数据不过「文本」这道关
先过素材海关。MKB = Monkey King Bang(神珍——金箍棒在东海龙宫的本名,一根铁如意变化万千),上海科学智能研究院(SAIS)团队,arXiv 2607.20557(2026-07-17),代码 Apache-2.0 开源。文案骨架全部属实:Qwen3-VL-8B 共享骨干 ✓、六分支(DNA/RNA/蛋白质/小分子/地球系统/医学影像)✓、原生输入输出(分子字符串/气象场/分割掩码)✓、”转文本丢结构”的动机 ✓——论文原话:现有系统”要么专科,要么主要靠文本 token 化与提示接口统一科学数据,无法处理多样科学输入、产出模态原生输出”。文案没给的数字补上:总参数约 11B;Biology-Instructions 20 个任务 17/20 进前二,超过 Intern-S1-Pro(1T 参数,16/20);中期天气预报在评测设定下优于 ECMWF 业务系统 HRES(Pangu-Weather/GraphCast 同款基线);医学影像多模态总 Dice 最佳;科学训练后通用能力基本保留。两处校准:①GitHub 目前 37 star——机构打法、财经媒体稿先行,社区热度尚未起,与 Semantica 的病毒式 star 是两种画像;②论文是 7 月 17 日的,素材晚了六周,作为”新发布”转述需校准时间戳。
一、接口税:第一次有了对照实验
这篇报告里最值钱的不是 11B 打平 1T,是那个同规模对照组:ChatMultiOmics——Llama-3.1-8B 微调,把 DNA/RNA/蛋白质/分子序列直接当文本 token 表示,无模态编码器。同一张 Biology-Instructions 考卷:
ChatMultiOmics(8B,文本化) 7/20 进前二 MKB(8B 骨干+原生编码器) 17/20 进前二 Intern-S1-Pro(1T,文本化) 16/20 进前二
这是”接口丢结构”命题目前最干净的一次产业级测量:参数量恒定时,文本化接口 vs 原生编码器差出 10 个名次;万亿参数买不回 8B 原生接口丢掉的结构。Intern-S1-Pro 用 100 倍参数补文本接口的损耗,勉强追平——论文的措辞很准:”largest current scientific multimodal LLMs focus on textual scientific reasoning and do not natively emit continuous-field forecasts or high-resolution segmentation masks”。梯度上不去的结构,参数堆不回来。这给接口经济学补上了缺失的一环:此前证据(CLEVR 消融、Semantica 图原生 vs 向量 RAG)都说”结构在接口处丢失”,MKB 给出了价格——这个税,一百倍参数只够补到及格。
二、冻结主干:遗忘问题的训练学解
MKB 的两阶段课程论文自称 “modality-then-language”:Stage 1 冻结 Qwen3-VL 主干,只训各模态编码器/适配器/解码器;Stage 2 再用科学+通用混合语料做七模态联合巩固。两个效果,对应两条主线:
其一,通用能力保留。 科学数据训练最容易把骨干的通识冲掉(灾难性遗忘)。MKB 的解法是把模态组件做成隔离层——科学梯度只流向编码器,主干冻结期零污染;Stage 2 用混合语料温和巩固。这是 Mobius「知识-推理解耦=干净遗忘的架构前提」的训练学实现:解耦不发生在参数里,发生在梯度通路上。
其二,对 vision laziness 的第二种解法。 FAIR×Oxford 的多模态预训练物理说:语言 warm-up 越久视觉通路越躺平,解药是早期统一让捷径不存在。MKB 给出另一个答案:让捷径无法形成——主干冻结期间,语言通路不参与竞争(梯度不流),每个模态的表示学习先独立站稳,再进联合课堂。同一物理,两种工程:早统一 vs 先分立后统一。哪种更优没有结论,但”冻结强势通路”这个操作值得所有多模态训练工程师记下。
三、被低估的部分:数据纪律
论文把数据构造称为”一等公民”,其中最硬的一条是 entity-level 切分与泄漏控制:蛋白按聚类、分子按骨架(scaffold)整体分配到单一 split——原话:”随机记录级切分会系统性高估生物数据上的性能,因为近重复序列和骨架会跨过切分边界”。生化 ML 圈大量漂亮数字死于这一条。这是 ARS/WRC 的验证纪律落在数据工程层的样子:不控制泄漏的 benchmark 分数不是证据,是幻觉。另外跨模态监督(酶催化 protein×molecule、RNA-蛋白互作)在网页语料里不存在,只能从 BindingDB 这类结构化库里构造——科学数据经济学与网页预训练根本不同:通用货币不是文本,是互作。
四、诚实边界:token 门前的精度死亡
论文自认的局限值得放大:”requiring precise scalar prediction 的任务表现仍不一致,尤其 ADMET 相关终点”。注意失败面的形状:原生结构输出(SMILES、气象场、分割掩码走各自的解码器)都好,偏偏是标量回归死在门口。这是”token 是贵的接口”的回归版——离散词表过投影窄门,结构可以分词存活,精度不能。多模态统一的失败表面精确映射接口经济学:结构走原通路,精度死在 token 门。和 SSP-BO 用 VSA 表示连续量的动机同源。报告没回避,加分。
五、主线回接
接口丢结构第十四验(科学基础模型版):十二验(CLEVR 预训练动力学)、十三验(Semantica 商业图谱基建)之后,MKB 补上科学计算域——且首次给出常参数对照定价。资源平权再添一子:11B 可训规模打出 1T 文本化的成绩,结构保留比参数规模更值钱。上海本地对局也有意思:SAIS(11B 原生路线)vs 上海 AI Lab Intern-S1-Pro(1T 文本路线)——同城两种哲学正面碰撞,MKB 用小两个数量级的模型先拿下考卷。
观察点:①37 star 的仓库六个月后是否有第三方复现与下游采用(机构发布的真实检验);②ADMET 标量短板会不会催生”标量头”这种新原生解码器——接口清单还缺一格;③ HRES 对比”on the evaluated settings”的限定词——中期预报的完整验证(极端事件、长时效)是气象圈的老考点。
— 信源:arXiv 2607.20557v1(SAIS Team,2026-07-17,HTML 全文精读,17/20、7/20、1T/16/20、HRES、Dice、ADMET 局限、冻结主干课程、entity-level 切分均核自原文);GitHub Shanghai-Academy-of-AI-For-Science/MKB(37 star,Apache-2.0,8-20 仍在推送);新浪财经/东财 2026-07-18 报道(110 亿参数、六类数据)。文案骨架忠实、零数字,数字全部由本文补齐并核对。转载请注明出处。
