手机扫描右侧二维码

可下载“浙江舆情”APP

  • 安卓版
  • IOS版
您当前的位置 :浙江在线 > 浙江舆情网 > 舆情解读 正文

浙江首批55名科学数据官上岗

发布时间:2026-09-17 17:39:09 来源:浙江在线-浙江日报 记者 何冬健 通讯员 郑煊

  浙江在线9月17日讯(记者 何冬健 通讯员 郑煊)日前,浙江省首批55名科学数据官正式上岗。

  这批人有一个共同特点:他们本身就是各领域的科研负责人——全国重点实验室副主任、研究院执行院长、资深研究员,如今又多了一个新身份:科学数据官。

  当前,海量科研数据分散在我省高校、实验室、企业内部,科学数据“不愿共享、不敢共享、不会共享”的困境普遍存在。数据权属不清、共享机制缺失、安全边界模糊,导致大量宝贵的数据资源被“束之高阁”,严重制约了数据要素价值的释放。

  当人工智能的浪潮席卷而来,科学数据官的工作,变得前所未有地迫切。

  数据“不出阁”,困局何解

  首批55名科学数据官来自51家科创平台,集中于生命科学、新材料新能源、制造等领域。

  省科技厅重大任务与专项处副处长邵晖解释,选这几个领域主要是从浙江的产业基础、AI赋能的潜力来考虑的,“比如生命科学领域,之江实验室与华大研究院已经有比较深入的合作,训练了多个垂域模型。这次联动医院等单位开展数据集共建,也是把相关经验进行复制拓展的一个尝试。”

  选定了领域,但真正要让数据“出阁”,并不容易。

  履新科学数据官后,杭州华大生命科学研究院执行院长刘龙奇已与多家医院进行沟通交流,目的是说服医院把沉睡的临床数据“唤醒”。

  合作意向早已有之。医院有海量样本,研究院有领先的数据分析能力。但每一次谈到实质性的数据共享,对话便陷入胶着:“数据出去了,还是不是我的?”“出了问题谁负责?”“论文发了算谁的?”

  医院的顾虑不无道理。2020年,一项对我国逾2000名科研人员的调查显示,研究人员虽有分享数据的意愿,但也担心数据误用及版权、许可受到侵犯。

  省农科院研究员、农产品质量安全全国重点实验室副主任肖英平是首批科学数据官之一,他告诉记者,企业委托科研团队开展的农产品质量安全与品质提升数据,“涉及企业的商业秘密,都不希望公开”。科研数据在企业手里,共享的阻力成倍放大。

  7月,《浙江省科学数据汇交与共享管理办法(试行)》与《浙江省科创平台科学数据官制度建设指南(试行)》两项新政出台,旨在加强和规范我省科学数据资源管理,加快建设具有国际影响力的科学数据库和人工智能就绪高质量科学数据集。其中最引人注目的一条,是“数据实体不出域”。

  “数据实体不出域”,即原始数据汇交到省里统建的数据汇交服务平台后,开放管理权限留在数据所有者手上,且数据不出平台。对于科研机构和数据持有方而言,原始数据往往涉及知识产权、核心技术或保密要求。传统的数据共享意味着“把家底交出去”,这让很多单位望而却步。“数据实体不出域”相当于给出了一颗“定心丸”——原始数据始终留在自己手里,所有权和控制权不发生转移,让数据以Token的方式用于模型训练或调用。

  邵晖说,“数据不走,接口走”,通过这一方法,既保护了数据所有方的权益和安全,又实现了数据的开放共享。此外,对于未公开发布的数据,支持通过分级分类、可信数据空间、Token化之后通过模型共享等方式进行共享,确保数据安全。

  数据官的麻烦事

  科学数据官不是个清闲差事。与以往科研机构数据集工作相比,科学数据官突出了科研范式变革和生产方式转变。

  “不能只是整理数据、写说明文档。他们需要思考这些数据能不能喂给大模型?喂出来有什么用?”邵晖说,科学数据官构建的数据集要面向大模型训练和推理,关注多模态数据的对齐和Token化,基于数据集构建垂域模型。

  浙江师范大学地理与环境科学学院副教授林兴稳的亲身经历,或许最能说明科学数据官这个角色为何必要。他所在的全省流域环境数智监测与修复重点实验室聚焦钱塘江中上游流域,围绕水、土、气、生物多样性开展监测。他正在参与制定一项数据分级分类团体标准:原始数据为L0级,经质量控制为L1级,深加工赋予物理含义后为L2、L3级,针对行业应用进一步加工为L4级,“分级之后,数据可以有条件地开放共享。”

  当然,从传统科研单位研究员到科学数据官,也存在转型和学习的过程,关关都有坎。有部分专家坦言,对科学数据官的职责和工作依然不熟悉,这是科学数据官面临的第一道坎。

  第二道坎是能力短板。AI就绪需要技术能力,但传统领域科研人员往往缺乏编程和AI基础。如在肖英平所在的农产品质量安全全国重点实验室,大多数科研人员不擅长编程,想引进既懂AI又愿意在农业领域深耕的年轻学者“相当困难”。大量科研人员需要跨越一道不低的门槛。

  第三道坎在于数据本身的差异性。同样的样品,不同实验室用不同方法、不同仪器测出来,结果可能相差很大。这种差异无法简单修正,但在数据汇交中可以通过互补来提升数据价值。

  “这次开展科学数据汇交的一项重要工作就是制定数据标准,要求汇交数据时提供必要的说明文档——数据采集的方法、加工转换的过程、质量控制的措施,通过这些方面来提高数据的有效性。”邵晖指出,目前要求必须汇交的是省级财政支持的科研项目数据,其中绝大部分以论文、专利的形式公开发布。

  针对AI领域的能力短板,当前省科技厅正在筹备“种子班”,通过具体科研或产业任务,集聚跨学科人才进行实战训练。省科技厅相关处室负责人介绍,该训练计划分两个阶段:第一阶段面向全体科学数据官,用一到两周时间集中授课,重点交流大模型时代科学数据建设的背景、方法、技术和工具;第二阶段面向部分有较好基础的领域,通过一个月左右的联合攻关,力争在高质量数据集、垂域模型、科研场景智能体等环节取得标志性成果。

  让难事有甜头

  2026年3月,海纳数据枢纽创新中心(杭州)项目建设启动。这是之江实验室打造的集算力、数据、模型于一体的人工智能开放创新基础设施,旨在为创新主体提供一站式的语料生产、模型训练和开发服务。浙江将依托之江实验室海纳数据枢纽创新中心,启动科学数据汇交与服务平台建设,打造科学数据资源化与科学智能的统一底座。

  壹生检康(杭州)生命科技有限公司是首批尝到甜头的企业。这家研发“豆蔻妇科大模型”的团队,入驻之江实验室海纳数据枢纽创新中心后,使用其研发的数据生产管线,完成了百万级高质量医学数据的Token化,并在技术人员帮助下将模型迁移至国产GPU卡上训练和部署。上线后服务省内多家医疗机构,通过主任医师级认证。

  “我们的实践证明,中小微企业团队完全能够在专业训练平台支持下,通过科学的训练方法、高质量的领域数据与聚焦式技术攻坚,快速打造出达到顶尖专业水平的专属大模型。”企业相关负责人说。

  但并不是每个数据贡献者都有这样的条件。更多科研人员面临的是:整理数据耗时耗力,却在职称评定、项目考核中“不算数”。

  浙江试图回应这个痛点。当前,浙江数据新政除了明确科学数据汇交不改变其原有权属,鼓励进行数据知识产权、数据产权登记外,还将高质量科学数据作为研究成果纳入科研评价体系,积极推动在科学技术奖励中体现科学数据贡献,让科研人员从“被动交”变为“主动汇”。

  有专家进一步建议,在省尖兵领雁、自然基金等项目申报时,加入“作为科学数据公开”的条款。肖英平对此深有共鸣。他认为数据共享最重要的是“自上而下”:“科研人员想的是,这个东西是我做的,为什么要跟别人共享?如果从政策层面驱动,比如科技厅设置项目的时候,把数据上传作为完成指标来约束,大家就会自然地往那方面做。”

  从政策文本到现实落地,依然有一段距离。一位参与过多个重大科研项目的学者告诉记者:“真正让每个项目组都认真对待数据汇交,还需要配套的考核机制、技术支持和培训体系。否则很容易变成‘交差了事’。”

  邵晖透露,省尖兵领雁项目和自然科学基金项目的任务书中已经加入了科学数据汇交的相关要求,“目前初步打算从科学数据官负责的省级科研项目,或者他们所在平台承担的省级项目先作为试点,后续全面覆盖省级项目。”

  据了解,近年来浙江已布局“人工智能+”数据集领域省尖兵、领雁项目50余项,取得人类基因组基础大模型、多孔材料领域模型等重大科技成果。谋划实施人工智能科学数据集重大科技专项,突破多领域多模态数据Token化等关键技术,在眼科医学、现代纺织、磁性材料等十余个领域建设数据集。下一步,省科技厅将推进科学数据汇交与共享平台开发,深化之江实验室海纳数据枢纽创新中心(杭州)建设。同时,在重点领域打造“人工智能+科学”标杆应用场景,赋能千家以上科技型企业,加速构建全球“人工智能+科学”开发者开源社区。

标签:数据集;数据汇;原始数据;模型;共享;科研人员编辑: