深度:推进肿瘤临床大数据研究应用的需求和挑战

2017-04-20 佚名 中国数字医学

国家癌症中心/中国医学科学院北京协和医学院肿瘤医院胸外科高亦博,讲述推进肿瘤临床大数据研究应用的需求和挑战。


国家癌症中心依托中国医学科学院肿瘤医院,是全国肿瘤防治研究和信息交流的中心,承担着采集和发布全国肿瘤登记数据、建立全国癌症防治协作网络、开展全国癌症防控科学研究的职责,牵头组织实施城市、农村、淮河流域癌症早诊早治项目以及肿瘤高发现场工作,也是国家肿瘤规范化诊治质控中心、国家肿瘤临床医学研究中心等,是全国肿瘤临床大数据汇集、分析、研究、上报、发布的中心。在参与国家癌症中心/中国医学科学院肿瘤医院承担的肿瘤临床大数据相关研究项目过程中,也曾反复遇到一些难点和问题,在处理过程中得出了一些经验和体会,由此对未来的肿瘤大数据研究重点和难点有了更深认识。

肿瘤临床大数据系列研究布局

医科院肿瘤医院胸外科早在“十五”、“十一五”时期,即依托中国抗癌协会食管癌专业委员会,牵头开展全国食管癌规范化诊治监察网络平台的建设工作。作为国内最早建立的肿瘤专病大数据智能化信息网络平台,联网全国82家在食管癌临床诊治方面具有较大规模和较高水平的三级甲等医院,并设立了12个地区级分中心,涵盖了除台湾、西藏的所有省级行政单位,采用规范化的数据标准和网络直报平台,累计录入食管癌的手术和综合治疗病例3.26万例,为全国食管癌诊治技术和模式的规范化做出了独特贡献,作为“食管癌规范化诊治关键技术的研究与应用推广”的重要组成部分,获得2013年国家科学技术进步奖一等奖。

十二五期间,在此前食管癌临床大数据网络建设和研究成功经验的基础上,国家癌症中心/肿瘤医院承担了国家科技支撑计划项目“基于癌症监测信息网络的肿瘤规范化诊治研究”和国家高技术发展(863)计划“恶性肿瘤大数据处理分析与应用研究”的任务,针对我国发病率、死亡率高,社会负担较重的八大肿瘤:肺癌、肝癌、食管癌、胃癌结肠癌、直肠癌、乳腺癌、宫颈癌,联网东北、华北、华中、华东、华南、西南、西北七个大区,14家有代表性和地区领先示范作用的省级肿瘤医院/癌症中心,开展肿瘤大数据获取、存储、处理与分析的关键技术研究,构建肿瘤大数据中心和系统平台;应用大数据技术对肿瘤治疗过程中产生的海量临床数据进行处理与分析,形成以肿瘤单病种为主题的数据集;构建知识库及分析模型库,为肿瘤疾病的诊治提供决策支持;开展肿瘤规范化诊治研究,建立质量控制体系,优化肿瘤防控策略,提高肿瘤的综合诊治水平等。

肿瘤临床大数据系列研究主要内容和进展

当前肿瘤大数据研究的具体内容可以简要概括为以下几个方面:①确定采集数据的内容及规范:包括患者人口学基本信息、发病及诊断信息、治疗信息、随访信息、科研信息等;②构建全国癌症监测网络:搭建网络基础架构、数据交换、数据中心、业务应用、综合管理等;③构建肿瘤单病种数据库:确定各专业数据库字段,将结构化字段自动导入系统,采用数据挖掘工具将非结构化数据纳入等;④综合数据分析:预定报表模型深入挖掘分析肿瘤分型,诊疗,癌症死亡分析,癌症控制统计分析,治疗费用等;⑤数据上报质量控制:设计信息系统标准数据接口,规范数据字典;收集各医院的接口数据,校验上报数据,对整体性、种类完整性、数据项完整性等进行检查;数据清洗,处理问题数据,收集原始资料,保障数据溯源;组织医疗专业人员进行业务逻辑核查和数据修正,并对数据字典和采集规范进行补充、完善等;⑥癌症规范化诊治研究:制定或更新适合中国国情的癌症诊治规范,修改完善符合我国患者特点的癌症分期标准,获得符合循证医学的高级别证据用以指导临床。

截至2016年,项目已经由行业专家协商制定拟采集的数据内容及规范,编制统一的数据字典,结合我国广泛采用的医疗信息化系统特点,确定了包括电子病历、检验检查、处方医嘱、治疗计划、随访信息等在内的20个大项、400余个小项的采集规范;完成国家癌症中心与 14 家省级肿瘤医院的加密VPN网络接入,完成服务器、防火墙、网关等基本硬件的部署,实现了数据推送和抓取;建立了自主知识产权的集成开发环境,支持各种结构化、半结构化、非结构化数据的处理。参考大数据项目的数据规范和工作经验,制定了多种常见肿瘤的单病种规范化诊治的医疗质控指标,已上报国家卫生计生委医政医管局。

肿瘤临床大数据研究中的常见问题与解决

通常认为,可以视为大数据的数据资源一般具有:数据总量大、数据结构和类型复杂、单位数据价值密度较低、生成速度快等几个共同特征。因此其数据特征与常规的基础和临床医学研究、循证医学临床试验等均有比较显着的区别,对开展和从事大数据研究的医疗机构和相关专业人员提出了独特的需求和挑战。在此仅举三个典型话题进行初步的探讨。

1.保障医院信息化系统运营安全是开展临床大数据研究的前提

医院信息化系统已成为大型医院临床业务正常运转的必备条件,其持续稳定运行的保障是医院信息部门的工作重点。另一方面由于工作职责优先级的不同,医疗机构开展的公共卫生、基因组学研究对大数据存储、管理和分析的需求往往不能从院级医疗信息平台得到充分保障,时常造成资源的重复建设,提高了研究的时间、人力和经费成本。两方面的矛盾需求可以采用与医院业务系统相对独立建立大数据研究专用数据仓库,并且在运行压力较小时与集成平台或临床数据仓库通信的方式获取数据来解决,直至开发成具有比较完整独立的业务逻辑的产品后,再反哺业务系统。

2. 临床大数据内涵和外延的延伸模糊了数据规范性、规则完备性、参照完整性的边界

除了临床诊疗中被动积累的业务系统运行数据、电子病历和影像检查数据以外,医疗机构主动开展的肿瘤相关基础和临床研究也产生了具有庞大数据量或涉及大规模人群的基因组学、人群或队列筛查体检数据等,已成为肿瘤大数据的重要来源。但由于各自数据类型和结构特征的巨大差异,很少有成熟的医疗信息化平台或工具可以将之整合,导致付出很高成本获得的数据资源难以充分发挥其作用和价值。此外,尽管临床大数据的采集不再设置很高门槛,然而循证医学临床研究范式中的选择性偏倚、幸存者偏倚、测量偏倚等混杂偏倚和数据间的交互作用仍是设计数据分析策略、报表、发布研究结论等过程中需要充分考虑的问题,即肿瘤临床大数据研究本质上仍然属于医学研究,其结论的得出不应因为采用大数据技术而对方法的合理性或结论的可信度降低要求。

3. 需要着力注意避免专业偏见和关注虚假需求

当前从事大数据研究开发的复合型人才严重缺乏,从业人员很大一部分来自于IT产业,或者具有分子生物学或生物信息学基础研究背景,然而不同学科、不同角色的需求大相径庭,在研究和产品中常会限于先验偏见或偏离真实需求。比较典型的例子如以下四种。

(1)不能摆脱原有专业思维习惯:肿瘤学和基因组学研究常倾向于使用覆盖数百个基因,可能有较多新发现的基因测序Panel,甚至用全外显子组、全基因组测序在临床样本中进行筛选,然而临床应用需求则主要集中于有靶向和免疫治疗药物使用指征的个别基因甚至个别突变位点的检测。过多的基因分析结果给临床解读、医患沟通和实际应用都带来了过多的工作量,却难有明确的临床获益。

(2)对研发成本和实用难度估计不足:部分医疗大数据研究团队在尚无充分证据时,贸然将产品定位为替代医生的智力劳动,然而其成本或效率优势仍主要存在于纸面估算,只关注到理论边际成本很低的优势,而对前期开发、验证和推广的时间成本和社会成本估计不足。

(3)研究目的与真实需求错配:例如以媒体报道的看病难、看病贵为默认前提,而实际上在很多情况下一般性医疗服务可及性不差,但是有效需求不足;优质医疗服务可及性差,但由于负荷已满而缺乏进一步提高可及性的动力。部分所谓颠覆性技术成果并未设置严格的对照,缺乏专业权威认可的严格实践检验,并且没有充分考虑医疗行为主客体即医生与患者的心理诉求。

(4)超越知识和技术发展阶段:通过机器学习支持临床决策支持和提高诊疗水平,必须依赖大批高质量的训练数据和详尽临床转归、结局、随访等信息的迭代优化,这样的数据仍然十分稀缺。近年来生物医学界已经越来越多地意识到公开发表论文中,大部分的结论无法严格重现。根据众所周知的“Garbage In,Garbage Out”(无用输入,无用输出)一般规律,当大多数医生诊疗水平无法与顶尖专家相比时,大数据研究方式反而有可能成为劣势。

结语和展望

随着大数据和互联网技术的飞速发展,以及临床大数据研究开发的快速推进,肿瘤临床大数据研究未来的发展方向仍会继续坚持科学审慎原则,整合生物-医学大数据,推动临床真实需求导向和应用驱动的增量改进。以国家级重大研发项目为牵引,依托肿瘤早诊早治和规范化诊治体系、医保单一付费体系等,医疗大数据的所有权、使用权、收益权的归属问题,患者知情同意、隐私保护,医疗机构信息烟囱、信息孤岛等长期困扰临床大数据技术发展的问题有望得到缓解。

版权声明:
本网站所有内容来源注明为“梅斯医学”或“MedSci原创”的文字、图片和音视频资料,版权均属于梅斯医学所有。非经授权,任何媒体、网站或个人不得转载,授权转载时须注明来源为“梅斯医学”。其它来源的文章系转载文章,或“梅斯号”自媒体发布的文章,仅系出于传递更多信息之目的,本站仅负责审核内容合规,其内容不代表本站立场,本站不负责内容的准确性和版权。如果存在侵权、或不希望被转载的媒体或个人可与我们联系,我们将立即进行删除处理。
在此留言
评论区 (2)
#插入话题
  1. [GetPortalCommentsPageByObjectIdResponse(id=189172, encodeId=81241891e2b4, content=推进肿瘤临床大数据研究应用的需求和挑战, beContent=null, objectType=article, channel=null, level=null, likeNumber=63, replyNumber=0, topicName=null, topicId=null, topicList=[], attachment=null, authenticateStatus=null, createdAvatar=http://cacheapi.medsci.cn/resource/upload/20170207/IMG589913E36908D4741.jpg, createdBy=99331680071, createdName=knowheart, createdTime=Thu Apr 20 22:29:08 CST 2017, time=2017-04-20, status=1, ipAttribution=), GetPortalCommentsPageByObjectIdResponse(id=189110, encodeId=4dda189110cf, content=学习了,谢谢, beContent=null, objectType=article, channel=null, level=null, likeNumber=75, replyNumber=0, topicName=null, topicId=null, topicList=[], attachment=null, authenticateStatus=null, createdAvatar=https://wx.qlogo.cn/mmopen/NUyjXTCJjo6KcicAVC1MwuOWcPEsEP4FrvDcicue5V6rMkmXmY73KjYP59vQrEdjU89iaN4ZkOhsItlHkmGTjhV3b5S3zOQA4E0/0, createdBy=cc261682151, createdName=卡圣, createdTime=Thu Apr 20 17:52:08 CST 2017, time=2017-04-20, status=1, ipAttribution=)]
    2017-04-20 knowheart

    推进肿瘤临床大数据研究应用的需求和挑战

    0

  2. [GetPortalCommentsPageByObjectIdResponse(id=189172, encodeId=81241891e2b4, content=推进肿瘤临床大数据研究应用的需求和挑战, beContent=null, objectType=article, channel=null, level=null, likeNumber=63, replyNumber=0, topicName=null, topicId=null, topicList=[], attachment=null, authenticateStatus=null, createdAvatar=http://cacheapi.medsci.cn/resource/upload/20170207/IMG589913E36908D4741.jpg, createdBy=99331680071, createdName=knowheart, createdTime=Thu Apr 20 22:29:08 CST 2017, time=2017-04-20, status=1, ipAttribution=), GetPortalCommentsPageByObjectIdResponse(id=189110, encodeId=4dda189110cf, content=学习了,谢谢, beContent=null, objectType=article, channel=null, level=null, likeNumber=75, replyNumber=0, topicName=null, topicId=null, topicList=[], attachment=null, authenticateStatus=null, createdAvatar=https://wx.qlogo.cn/mmopen/NUyjXTCJjo6KcicAVC1MwuOWcPEsEP4FrvDcicue5V6rMkmXmY73KjYP59vQrEdjU89iaN4ZkOhsItlHkmGTjhV3b5S3zOQA4E0/0, createdBy=cc261682151, createdName=卡圣, createdTime=Thu Apr 20 17:52:08 CST 2017, time=2017-04-20, status=1, ipAttribution=)]
    2017-04-20 卡圣

    学习了,谢谢

    0

相关资讯

Oncogene :上海生科院阐明 Hippo 通路关键转录因子 TEAD4 特异性结合 DNA 机制

4月5日,国际学术期刊 Oncogene 在线发表了中国科学院上海生命科学研究院生物化学与细胞生物学研究所 / 分子细胞科学卓越创新中心周兆才研究组的最新研究成果 DNA-binding mechanism of the Hippo pathway transcription factor TEAD4。该研究在原子水平上阐明了 Hippo 信号通路下游关键转录因子 TEAD4 特异性识别结合

权威解读:肿瘤,要像“慢性病”那样治

日前,一项涉及我国31个省市自治区,涵盖200多个城镇的统计数据显示,我国癌症发病率和死亡率持续上升,已经成为城乡居民的最主要疾病死亡原因,我国肿瘤发病情况不容乐观,多数患者一经确诊就是中晚期。

免疫疗法是稻草还是救生圈

2016年4月12日,魏则西在家中去世。由于他生前采用了某种癌症免疫疗法,使得免疫治疗在中国的乱象被置于舆论的聚光灯下:未经批准、夸大疗效、费用高昂……2016年5月初,国家卫计委重申,自体免疫细胞治疗技术仍属于临床研究,不能进入医疗临床应用。此后,商业性应用并收费的免疫疗法在全国叫停。

Genome Med:能量工厂线粒体DNA在结直肠腺癌中是如何跑路的?

结直肠腺癌的特征是线粒体DNA(mtDNA)拷贝数异常和基因组不稳定,但是线粒体和核基因组之间的分子相互作用仍然未知。

Sci Trans Med:重磅级发现!特殊血管或能增强抗肿瘤免疫疗法的效力

近日,来自Flanders生物技术研究所等多个机构的研究人员通过研究表明,抗血管生成疗法能够帮助改善免疫增强疗法,而将这两种疗法相结合或能促进特殊血管生长,并且运输抗癌免疫细胞进入肿瘤发挥抵御癌症的作用,从而就能够使得疗法变得更加有效同时患者的生存期更长。相关研究刊登于国际杂志Sc

Oncotarget:中南大学梁德生课题组发表基因编辑干细胞对肿瘤生长抑制的研究进展

日前,国际肿瘤学学术期刊《Oncotarget》杂志上在线发表了中南大学生命科学学院医学遗传学国家重点实验室梁德生课题组在基因编辑干细胞抑制肿瘤生长研究的新进展,文章题为“Enhanced tumor growth inhibition by mesenchymal stem cells derived from iPSCs with targeted integration of interle