随着AI写作工具的普及,人们越来越习惯让机器生成文案、诗歌甚至代码。但AI技术的真正野心远不止于此——当大模型开始理解DNA序列、预测天气变化、分割医学影像时,一场由AI技术驱动的科学革命正在悄然发生。近日,上海科学智能研究院(上智院)正式开放了科学多模态基础模型“神珍”(Monkey King Bang, MKB),以约110亿参数统一处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,在保留各自领域差异的同时,实现跨场景的推理与生成。这不仅是AI for Science领域的一次重要突破,更让我们看到:当AI写作还停留在文字层面时,真正的“智能”已经走向了更复杂的物理世界。
从单一任务到统一模型:多模态AI的进化逻辑
过去几年,AI技术在各垂直领域取得了显著进展:蛋白质结构预测有AlphaFold,气象预报有GraphCast,医学影像有专用分割模型。但这些模型彼此独立,像一座座孤岛。科学家要处理一个涉及蛋白质、小分子和气象的复杂问题,就需要在多个模型之间手动切换,数据格式不统一,学习到的规律也无法共享。
“神珍”的诞生正是为了打破这种割裂。它采用Qwen3-VL-8B作为共享主干,为六类科学数据分别设计数据处理通路。与传统的“把所有数据转换成同一种格式”的思路不同,“神珍”保留每种数据的原始结构:序列强调前后依赖,分子强调原子连接,气象场强调时空演化,医学影像强调局部细节。这种设计让模型能够同时学习可共享的规律(如序列模式、空间关系)和领域特有的结构,从而在统一框架下实现科学理解与结果生成。
这一思路与AI Agent技术的发展不谋而合——智能体需要处理来自不同来源的信息,而统一表征是跨任务协作的基础。与此同时,大模型训练的规模化效应也在“神珍”身上得到体现:110亿参数虽然不算最大,但通过精心设计的数据通路,它用相对精炼的形态承载了多样化的科学任务。
科学数据的“巴别塔”:如何让不同领域数据对话
每种科学数据都有自己的“语言”:DNA是碱基序列,蛋白质是氨基酸序列,小分子是原子连接图,气象是网格化时空场,医学影像则是像素阵列。要让一个模型同时理解这些语言,就像让一个人同时精通汉语、英语、数学符号和乐谱一样困难。
“神珍”的解决方案是:为每种数据设置独立的“编码器”入口,在进入共享模型前保留其原始结构特征。例如,蛋白质和核酸仍按序列处理,小分子仍按图结构处理,气象数据仍保留空间分布,医学影像则保留图像细节。这些编码器就像同声传译员,将不同领域的“方言”转换为模型能理解的“通用语”,但同时又保留了原语言的韵味。
在具体实现上,模型支持文本问答、RNA序列生成、SMILES分子表示输出、全球气象场滚动预报以及医学影像分割结果。这意味着,用户只需输入一段文字描述,模型就能直接生成对应的科学数据。例如,输入“预测这个分子在37℃下的水溶性”,模型会输出SMILES表示和属性预测。这种“文本到科学数据”的能力,与文生图、AI诗词等生成式AI有异曲同工之妙,只不过生成的不是图画或诗句,而是实实在在的科学结果。
110亿参数的科学大脑:性能与效率的平衡
在科学智能领域,参数规模往往被视为能力的重要指标。但“神珍”用实际表现证明:参数不是唯一维度,如何设计模型架构、如何组织数据、如何训练,同样关键。
在生物序列理解任务中,“神珍”在20项任务里有9项取得三款参评模型中的最优结果,17项位列前二。与同量级的Biology-Instructions相比,“神珍”在16项任务上得分更高;与参数规模约1万亿的Intern-S1-Pro相比,两者各在10项任务上胜出。这组数据极具说服力:一个110亿参数的模型,在多项任务上能与万亿级模型打平,靠的就是对不同科学对象建模方式的精细化设计。
在小分子领域,公开基准SMolInstruct的6项属性理解任务中,“神珍”有4项取得或并列取得最优结果。气象方面,给定一帧初始大气场,模型每6小时滚动预报一步,持续推演至第10天,其500hPa位势高度、2米温度、海平面气压等指标达到或优于业务级数值预报水平。医学影像分割方面,在覆盖CT、MRI、病理等九种模态、逾十万个样本的评测中,平均Dice得分91.20,7种方法中排名第一,其中5类影像模态独占鳌头。
这些成绩表明,AI技术在科学领域的应用已经进入深水区。对于科技产品研发者而言,这也意味着未来可以基于此类模型开发更智能的科研工具,比如将AI工具导航与“神珍”结合,让研究人员一键调用不同科学模块。
从气象到医学:统一模型的实际应用场景
“神珍”将四类代表性能力汇集在同一个统一模型中:理解生物序列,预测小分子性质或生成SMILES,滚动生成最长10天的全球气象场,以及根据文字提示完成医学影像分割。不同任务会调用相应的处理组件,但共享同一模型主干和联合训练的权重,研究者无需在多个彼此独立的领域模型之间切换。
以气象领域为例,传统数值预报依赖超级计算机运行复杂的物理方程,而“神珍”通过数据驱动的方式,仅用一帧初始大气场就能推演10天后的全球天气。在离线评测中,多项指标不仅超过了经典的ECMWF HRES,而且推理速度更快。这对于灾害预警、农业规划等场景意义重大。
医学影像分割是另一个亮点。在临床诊断中,医生需要手动标注病灶区域,耗时且主观性强。使用“神珍”,只需输入“分割出左肺下叶的结节”,模型就能自动生成精确的分割掩膜,平均Dice得分91.20。这一能力与抠图、背景去除等技术有相似之处,但处理的是医学影像中的复杂结构,精度要求更高。甚至可以想象,未来结合AI画图技术,医生可以生成模拟的病理图像用于教学。
开放共享:科学模型的“操作系统”时代
对于科学模型的开发共享而言,开放权重只是第一步。是否同时提供可运行的代码、示例和清晰的输入输出说明,直接影响模型能否被验证和复用。此次发布,上智院同步提供了模型权重、推理代码、示例脚本、输入说明和使用文档,并补充了气象预报与医学影像分割所需的配置,支持研究者开展本地部署或接入已有科研流程。
研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台汇聚的1500余个科学模型和工具一起组合与再创造。也可以在Hugging Face下载模型权重,在GitHub获取推理代码和示例。这种“模型即服务”的开放模式,让科学研究的门槛大幅降低,类似于操作系统对应用生态的支撑作用。
值得注意的是,“神珍”是今年3月上智院推出的系统级科研智能体“大圣”的超级大脑。取名自《西游记》中的“天河定底神珍铁”,寓意模型能以相对精炼的形态承载多样的科学任务,也希望更多研究者参与到检验、使用与共建中来。
未来展望:AI写作之后,AI技术如何赋能基础科研
从AI写作到科学模型,AI技术的应用边界正在不断扩展。如果说AI写作解决的是“如何用语言表达思想”,那么“神珍”则试图回答“如何用数据理解世界”。未来,随着多模态能力的提升,我们可能看到这样的场景:一位生物学家在实验中用自然语言描述问题,模型直接给出蛋白质序列、分子结构预测和气象条件建议——所有操作在一个统一平台上完成。
当然,挑战依然存在。科学数据的标注成本极高,不同领域的标准尚未统一,模型的鲁棒性和可解释性也需要进一步提升。但在“神珍”已经证明,通过合理的架构设计,我们可以用相对较小的参数规模撬动巨大的科学价值。这不仅是AI技术的胜利,更是科学方法论的一次革新。
对于普通用户而言,或许很快就能在AI工具箱或AI工具导航中找到类似“神珍”的插件,用于辅助科研、教育甚至个人兴趣探索。毕竟,当AI写作已经能写出好文章时,AI科学助手也正在路上。