专业咨询
致力推进中国医疗卫生信息化

梁志刚:医疗数据治理的本质,是围绕场景生产数据产品

来源:HIT专家网  作者:李崇铭

“当前,医院信息部门面对的不是单纯的数据导出需求,而是围绕场景生产数据产品的需求。高水平医疗数据集的‘量产’,无法依靠简单复制,而是必须建立完善的数据产品生产机制。”

近日,在北京信息化协会信息技术应用创新工作委员会与HIT专家网主办的“医疗数据治理方法与实践——2026年HIT专家网工程师讲坛”上,首都医科大学宣武医院(简称宣武医院)信息中心主任梁志刚分享了宣武医院从临床数据治理到高水平数据供给的探索经验。

首都医科大学宣武医院信息中心主任梁志刚

医院需要重新认识“医疗数据治理”

“医院信息化建设日趋完善,数据中心、数据湖等基础设施已基本落地。但科研、AI应用、专病等场景需要数据时,仍会出现数据找不到、不完整、口径不一致等问题。”梁志刚认为,医院数据“不好用”的原因是多方面的。

首先,应正视医院数据自身的特殊性。医疗数据中存在大量非结构化数据以及主观评价,缺乏客观指标。同时,诊疗过程涉及诊前、诊中、诊后,医疗数据要反映疾病诊治的全流程,用于临床研究和大模型训练的数据需要进行纵向管理,即对患者全流程数据进行持续关联与追踪。这对数据平台建设提出了更高的要求。

同时,医疗场景的数据需求正在发生根本性转变。数据正从资源转变为产品,其价值取决于能否解决实际业务问题。以往医院信息中心面临的临床数据需求,可能是帮助临床专家导出部分数据,工作方式是“一次一清洗、一次一解释”,如今已升级为“围绕特定场景生产数据产品”。比如,临床科研人员需要构建可研究的患者队列,影像AI训练需要“影像+报告+病灶标注”等数据,药械研发需要“治疗过程+随访+疗效+结局”等数据,此时都需要医院信息中心交付“可复用、可评价、可持续更新的数据集”。

“因此,医院数据治理的工作范畴,远远超出此前的平台建设与非结构化数据抽取工作,而是围绕场景持续加工数据,通过采集、关联、标准化、结构化、质控、标注等一系列流程,使数据可理解、可计算、可复用。”梁志刚强调,如果脱离业务场景、对整体数据进行全程治理,资源耗费多且意义不大。“用户拿到的数据质量不高、需要的数据又拿不到,这就难以解决业务问题。因此,数据治理一定要以场景为导向,建议从某一个具体问题入手。”

梁志刚认为,“有没有”“对不对”“能否解决问题”是数据治理从基础到高阶的递进逻辑。数据治理的终点不是“拼凑数量”,而是“拿到能解决问题的数据”。

高水平医疗数据集需同时满足六个条件

厘清数据治理的底层逻辑之后,进一步需要回答:一套能够解决业务问题的高水平医疗数据集,应当具备哪些特质?

“评判医疗数据集的质量水准,不能只看病例数量,数据颗粒度和可用性也是决定数据集质量的核心因素。”梁志刚介绍,从业务角度来看,高水平医疗数据集需同时具备以下六个条件:

第一,确保原始数据的可用性,首先要保证“真”。例如,CT/MRI要优先保留原始DICOM,支持序列、参数和空间信息追溯;数字病理优先保留WSI,避免缩略图丢失诊断级细节;超声/内镜优先保留原始视频或高质量文件,保留过程信息与关键帧上下文。

第二,确保临床文本的充分性,要从“结论”升级为“临床语义”,保留诊断依据与病情细节。大量临床文书的表述并不充分,比如仅有“阴性/阳性”等结论,通常不足以支撑高质量训练;诊断依据同样重要,需要补充病灶部位、大小、数量、密度等“高水平表达”。

第三,确保影像、报告、标签等多模态数据的稳定配对。从影像到病理、从检查到检验,不同模态的数据不需要“都放在一个文件夹里”,但每个层级之间需要有明确、稳定的关联键。

第四,标签粒度清晰。不同业务任务,对应不一样的数据颗粒度,对治理工作的要求也随之变化。以“报告生成”任务为例,“影像+报告”可满足普通场景的使用要求,但面向高要求科研或AI训练场景,则需要做到影像所见、报告结论、病灶位置三者的绑定对齐。“不存在脱离具体应用场景的、绝对高质量的数据,数据集质量要结合业务目标判断。”梁志刚强调。

第五,交付材料完整。正式交付的应是一套“数据产品包”,包含主体数据、标签与标注、结构化文本等。

第六,合规边界清晰。要注意脱敏、授权等隐私与安全问题,确保数据使用符合安全和合规要求。

宣武实践:从优势学科入手,沉淀高水平数据集建设能力

“先解决真实的业务场景问题,再将项目能力沉淀为医院的数据能力,这是医院数据治理、打造高水平数据集的关键。”梁志刚介绍,宣武医院的高水平医疗数据集建设不是从“大平台”开始的,而是先选择了一个具体问题——“颈动脉支架数据集”,逐一解决项目中暴露的各种问题,并沉淀项目数据治理能力。

颈动脉支架数据集的建设目的之一是赋能临床科研,其患者纵向专病数据来自EMR、检查检验、手术、医学影像、随访等多套医院系统。该数据集的建设从建立患者级关联开始,汇聚患者主索引、就诊关联、手术关联等数据,形成患者诊疗旅程,完整呈现患者诊疗全周期。

梁志刚强调,数据集建设一定要考虑患者的真实就诊流程,而不是站在单一业务系统的角度调取数据。单个业务系统的数据,往往是不全面、不完善、不客观的。

数据治理常见的一大难题是“如何将字段转变为临床变量”。例如,系统字段记录的是手术名称、耗材名称等,而临床科研需要的是术前风险病变特征、手术策略等信息。因此,医院信息部门需要在临床专家的指导下,补充更多详细的临床数据,既要保证数据的结构与一致性符合IT规则,又要使它的医学合理性符合临床规则,这需要信息科与临床专家共同定义数据质量规则,让临床专家的知识稳定进入数据生产流程,形成多部门协同的机制。

“我们的思路是做好前治理。因为医疗数据很复杂,它是医生临床经验、诊疗思路、学科水平的体现,如果前治理做不好,即便使用大模型进行后治理、分析,也很难出成效。”梁志刚说。

宣武医院通过建设此数据集,采用“前置型标注提升数据治理效率”的思路,完善高水平医疗数据集的治理流程,形成需求分析、数据评估、规则构建、批量处理、质量提升、数据安全自查的标准化SOP。截至目前,宣武医院已完成了30余个高水平数据集建设。

基于宣武医院医疗数据集的建设探索,梁志刚总结了几点经验:

首先,建设高水平数据集的关键点之一在于优势学科的参与。优势学科的专家更注重学术研究,更有意愿参与数据建设。而且只有优势学科才能吸引高质量的患者资源,才能积累出高水平的诊治过程和数据集。“应先做好1个数据集,形成数据品牌,再复制更多成果。”梁志刚说。

其次,以场景为导向,控制治理范围。数据治理应先确定用途,再确定样本体量、跨度、数据颗粒度等。如果用途不清晰,治理范围就会无限扩张,成本无限增加,难以见实效。

第三,建立体系同时管控数据质量与安全。如遵循数据采集的“最小必要”原则、对齐医疗数据标准、进行脱敏预处理等。

第四,高水平的数据集来自持续生产。只要路径确定、管理制度确定、规则确定,“数据飞轮”就会更多地沉淀,持续产出,使数据集建设在使用中不断迭代。

第五,可复制的不是数据库,而是生产机制。数据集建设真正需要复制的是场景选择方法、规则与质控体系、跨部门协作能力等。让下一个专病建设更快、更稳、更低成本,才是医院级数据能力的真正提升。

梁志刚介绍,宣武医院正在推进院内数据资产服务,梳理数据资产;推动高水平数据集向多模态数据集体系、数据产品体系、数据资产管理体系进阶。“真正的数据建设能力,一定是临床和信息管理部门共同协作的成果,这样的数据建设能力才可复制、可复用。”

【演讲视频】

微信扫描二维码,观看演讲视频

【资料下载】

此图片的alt属性为空;文件名为HIT%E4%B8%93%E5%AE%B6%E7%BD%91%E8%AE%A2%E9%98%85%E5%8F%B7.png
关注HIT专家网微信订阅号
精彩不容错过!
寻求“商务合作”请扫码填写需求
我们将尽快与您联系!

【责任编辑:陈曦 版式:明超】

赞(0)

评论 抢沙发

评论前必须登录!

 


未经允许不得转载:HIT专家网 » 梁志刚:医疗数据治理的本质,是围绕场景生产数据产品
分享到: 更多 (0)