大数据在数字医疗中的应用:全科医疗的经验教训与建议

摘要

大数据将成为下一代技术发展的核心组成部分——使我们能够从现代生活产生的海量数据中获得新的洞察。大数据在医疗保健领域的应用具有巨大潜力,但仍存在一些需要克服的障碍,例如碎片化、高成本以及关于数据所有权的问题。设想大数据在数字医疗环境中的未来角色,意味着要在改善患者治疗结果的好处与因实施不力导致增加复杂性而加剧医生职业倦怠的潜在风险之间取得平衡。肿瘤学是大数据收集和利用率先起步的领域,如癌症基因组图谱(TCGA)和癌症登月计划等项目即在此领域开展,美国(US)、英国(UK)及其他国家在将大数据应用于患者护理时所采取的集中化程度和监管方法呈现出不同视角,这为我们提供了有益的借鉴。通过借鉴全球方法,我们提出有关医疗保健数据使用的指南和法规建议,重点是创建一个唯一的全球患者ID,以整合来自各类医疗服务提供者的数据。此外,我们还进一步探讨了大数据可能存在的弊端,例如大数据研究中缺乏多样性,以及机器学习算法带来的安全性和透明度风险。

引言

下一代测序的出现有望彻底改变医学,因为如今已能够以低廉且可靠的成本对整个基因组、转录组、蛋白质组、代谢组等进行测序(Shendure 和 Ji 2008;Topol 2019a)。“基因组学”数据本身预计到 2025 年将达到 2–40 艾字节——超过由所有其他技术平台获取的数据(Stephens 等 2015)。到2018年,人类基因组的研究级测序价格已降至1000美元以下(Wetterstrand 2019)。其他“组学”技术,如蛋白质组学,也变得普及且成本低廉,并加深了我们对生物学的认识(Hasin 等 2017;Madhavan 等 2018)。消费设备的发展也显著推动了临床数据收集的进步,使得持续收集患者生命体征并实时分析成为可能。除了测序策略的成本降低外,计算能力和存储成本也变得极低。这些发展极大地促进了疾病诊断和治疗的进步,但也带来了新的挑战,因为大规模信息日益难以存储、分析和解读(Adi-buzzaman 等 2018)。这一问题催生了一个“大数据”新时代,在此时代中,来自各个领域的科学家正在探索理解现代技术产生的大量非结构化和未关联数据的新方法,并利用这些数据发现新知识(Krumholz 2014;Fessele 2018)。大数据在生物学中的成功科学应用已经得到证实,例如基因型‐表达项目等计划正在产生海量数据,以更好地理解基因调控(Aguet等 2017)。然而,尽管取得了这些进展,我们却很少看到大数据在医疗保健中的实际应用,尽管它为创造个性化和有效治疗提供了巨大机遇。

医疗保健中大数据的有效利用得益于机器学习(ML)方法的发展和部署。机器学习方法常与人工智能(AI)方法互换使用。直到如今,机器学习和人工智能才使得我们有可能揭示大数据时代所带来的复杂、非结构化、非规范化和未缩放数据集中的模式、关联、相关性和因果关系(Camacho 等 2018)。这使其能够对多种数据集进行可操作的分析,例如图像序列(适用于放射学)或叙述性文本(患者记录),并借助自然语言处理(Deng 等 2018;Esteva 等 2019)将所有这些数据集整合起来,生成预测模型,例如患者对治疗方案的反应。机器学习工具的应用也得益于美国通过《平价医疗法案》(2010年)和《经济与临床健康信息技术法案》(2009年)后电子健康记录(EHRs)的广泛采用,以及国家医疗服务体系(NHS)最近有限度的采用(Garber 等 2014)。电子健康记录使患者数据对患者本人、各类医生以及研究人员都更加易于获取,因为它支持远程电子访问和便捷的数据操作。肿瘤科护理尤其具有示范意义,展示了大数据如何直接改善患者护理。将电子健康记录与诊断检测(如磁共振成像、基因组测序及其他技术)相结合,是大数据的重大机遇,这将帮助医生更好地理解癌症背后的遗传原因,从而设计出更有效的治疗方案,同时改进预防和筛查措施(Raghupathi 和 Raghupathi 2014;Norgeot 等 2019)。本文综述了当前医疗保健领域大数据面临的挑战,并以肿瘤学为典型案例,重点探讨数据所有权、共享和隐私问题。

我们的综述基于美国、英国及其他全球医疗系统的研究成果,提出围绕唯一患者标识符和机器学习对电子健康记录进行根本性重组的建议。

大数据在医疗保健中的当前成功

英国和美国都是医疗保健领域的全球领导者,将在大数据的采用中发挥重要作用。我们已经在肿瘤学领域(癌症基因组图谱(TCGA)、泛癌症分析全基因组(PCAWG))以及神经精神疾病(PsychENCODE)(Tomczak 等 2015;Akbarian 等。2015;Campbell 等 2020)。这些大数据生成和开放获取模式已催生了数百项应用和科学研究出版物。这些倡议在说服科学界和医疗保健界认识到共享临床和分子数据的优势方面取得了成功,从而推动了全球多个领域的大规模数据生成计划,例如美国的“我们所有人”项目(Denny 等 2019)。英国现已确立了明确的国家战略,促成了英国生物样本库和10万名基因组项目(Topol 2019b)。这些项目与实施基因组医学的国家战略相契合,包括开设多个基因组测序中心,并将基因组测序引入英国国家医疗服务体系(NHS)的标准诊疗组成部分(Marx 2015)。美国尚无此类国家战略,尽管其已启动了自己的大型基因组研究——“我们所有人”——但并未制定在其医疗系统中实施的计划(Topol 2019b)。在本综述中,我们将讨论重点放在肿瘤学领域大数据的发展上,以此作为理解这一复杂且快速发展的领域并制定广泛的医疗保健指南的方法。

英国的大数据计划

英国生物样本库是一项前瞻性队列研究计划,由在疾病发病前年龄介于40至69岁的个体组成(Allen et al. 2012;Elliott et al. 2018)。该项目已收集了50万名个体的丰富数据,整合了生物样本、患者健康体征测量以及生活方式和人口统计学等社会学信息(Allen et al. 2012)。除了规模庞大之外,英国生物样本库通过与英国国家医疗服务体系的整合,提供了无与伦比的结局关联能力。这一统一的医疗系统使研究人员能够将初始基线测量值与疾病结局相关联,并结合来自医院住院和临床就诊等多种医疗信息来源的数据,从而更有效地减少疾病分类和诊断中的误差。此外,英国生物样本库还将开展常规随访试验,持续提供有关活动的信息,并进一步扩展生物检测,以改善疾病与风险因素关联的研究。

除了英国生物样本库外,英格兰公共卫生署还启动了10万基因组项目,旨在了解常见癌症的遗传起源(Turnbull 等 2018)。这一大规模项目包括英国国家医疗服务体系的患者同意对其基因组进行测序,并将其与健康记录关联起来。如果没有英国生物样本库中收集的大量表型信息——这些

该项目作为前瞻性流行病学研究的用途有限,但对希望识别致病单核苷酸多态性(SNP)的研究人员而言是一个极好的工具。数据集本身的规模是其主要优势——它提供了足够的统计功效,即使对于罕见病也能发现相关的SNPs。此外,10万基因组项目的一个辅助目标是促进英格兰基因组学产业内的私营部门增长。

美国及国外的大数据计划

在美国,“我们所有人”项目通过整合电子健康记录、行为数据和家族数据,将患者基因组数据与其表型直接关联,建立独特的患者档案,从而扩展了英国生物样本库的模式(Denny 等 2019)。通过为所有患者创建标准化且相互关联的数据库,“我们所有人”将使研究人员比使用英国生物样本库拥有更广阔的范围,以理解癌症并发现相关的遗传原因。此外,“我们所有人”成功聚焦于少数族裔人群与健康问题,这一重点使其独具特色,并具有更大的临床意义。英国应借鉴这一做法,扩展英国生物样本库项目,进一步纳入少数族裔人群,并将其与来自可穿戴设备等辅助性患者数据进行整合—目前英国生物样本库中,自认为白人的人数为 ~500,000,而非白人仅占 ~12,000(即仅为 <2.5%)(Cohn 等 2017)。与此同时,根据2011年英国人口普查,亚裔族群占英国总人口的比例超过7.5%,且少数族裔的比例预计在未来几年将持续上升(O’Brien 和 Potter-Collins 2015;Cohn 等 2017)。

瑞典也为投资丰富的电子研究登记系统的力量提供了一个富有启发性的例子(Webster 2014)。瑞典政府每年投入超过7000万美元,用于扩展多种癌症登记系统,使研究人员能够深入了解肿瘤发生的风险因素。此外,其数据来源对科学家尤其有价值,因为每位患者的记录都与唯一身份编号相关联,可与90多个其他登记系统进行交叉引用,从而更全面地了解患者的健康状况和社会环境。这些登记系统不仅限于疾病状态和治疗,还包括广泛的公共行政记录,可为研究人员提供关于收入、职业和婚姻状况等健康的社会指标的深入洞察(Connelly 等 2016)。这些数据来源对瑞典研究人员而言更具价值,因为它们已持续数十年并保持了令人称赞的一致性—增强了长期分析(Connelly 等 et al. 2016)。其他国家可以借鉴瑞典的经验,特别关注使用能够映射到政府和学术界收集的多个数据集的唯一患者ID patient IDfiers — 这一概念最早在—美国《健康保险可携性和责任法案》 HIPAA fi1996 年提出,但至今尚未实施(Davis 2019)。

中国最近在新数字技术的实施和发展方面处于领先地位,并开始强调数据标准化和数据量来推进医疗保健。中国政府已经启动了多项资助计划,旨在推动大数据在医疗保健用例中的应用,特别关注将行政数据、国家医疗保险计划的区域理赔数据和电子病历联系起来(Zhang 等 2018)。中国希望通过利用其现有的覆盖所有中国公民的个人身份识别系统来实现这一目标—类似于瑞典模式,通过个人身份识别号码连接各种区域和国家级登记系统。这对肿瘤学研究尤为重要,因为中国已建立了一个新的癌症登记系统(国家癌症中心登记处),将利用该国的人口规模,为原本罕见的肿瘤发生提供独特见解。该倡议面临的主要问题是数据质量和时间。中国仅在相对较近的时间才采用《国际疾病分类》(ICD)第十次修订版编码系统,这是一种用于记录疾病状态和处方治疗的标准化方法。

中国目前仍在地区层面实施标准化的记录术语。这导致了数据质量上的显著差异—以及地区之间的互操作性问题—这对任何国家级登记系统的努力都是一个重大障碍(Zhang 等 2018)。这些举措的近期性也意味着需要一段时间,研究人员才能充分利用纵向分析—这对旨在发现复发或追踪患者生存率的肿瘤学研究至关重要。未来,我们可以期待中国将其数亿患者的病历文件提供给研究人员使用,从而产生重要发现,但在护理标准和互操作性方面的重大进展必须首先实现。

全球正在进行的 “大数据”研究项目种类繁多,正在提出有关患者记录未来的不同方法。英国正广泛利用英国国家医疗服务体系的集中化优势,将基因组数据与临床护理记录相连接,并通过患者ID向研究人员开放疾病终点。瑞典和中国也在采用这一模式——利用向公民发放的唯一身份编号,将原本不连贯的行政和医疗记录数据集进行关联(Connelly 等 2016; Cnudde 等 2016;Zhang 等 2018)。通过这种方式,检测、技术和方法将以对患者特定但不一定对医院或诊所特定的方式整合。这使得在不同站点之间无缝传输信息具有显著的灵活性,并使医生能够充分利用所有生成的数据。美国“我们所有人”项目类似于将各种患者记录整合到存储在云中的单个患者文件中(Denny 等,2019)。然而,它并未显著连接公共行政数据源,因此在用于长期分析社会因素对癌症进展和风险的影响方面存在局限性。这预示着临床数据当前生态系统存在的更大问题——缺乏整合、设计不当以及数据所有权不明确,使得研究和临床护理变得更加困难,而非更加简便。

临床数据使用问题调查

碎片化

碎片化是电子健康记录若要在任何重要的临床场景中得到应用就必须解决的主要问题。当电子健康记录之间无法有效通信时,就会出现碎片化—从而有效地将患者信息锁定在专有系统中。尽管在美国电子健康记录领域有一些主要厂商,如Epic和通用电气,但也存在数十家小型和利基公司生产自己的产品—其中许多产品彼此之间无法有效或轻松地进行通信(DeMartino 和 Larsen 2013)。电子健康记录的临床肿瘤学要求和国家社区癌症中心项目均曾呼吁制定电子健康记录的互操作性要求,甚至发布了相关指南(Miller 2011)。此外,健康信息技术认证委员会成立的目的是为电子健康记录的互操作性发布指南和标准(Miller 2011)。快速医疗互操作性资源(FHIR)是由健康等级7(HL7)发布的当前最新的医疗保健数据交换标准。它基于HL7以往的标准以及诸如参考信息模型等多种其他标准。FHIR提供了通过RESTful API实现数据共享的新原则—并且Argonaut等项目正在努力扩大其在电子健康记录中的应用(Chambers 等 2019)。即使引入了HL7门诊肿瘤学电子健康记录功能规范,电子健康记录也未得到改善,反而成为临床医生的痛点,因为他们难以整合来自不同实验室或医院的诊断结果;如果患者更换了医疗服务提供者,甚至可能导致医生无法了解患者的临床病史(Reisman 2017;Blobel 2018)。即使在集成医疗服务提供者(如凯撒医疗集团)中,也存在互操作性问题,导致电子健康记录在临床医生中不受欢迎,因为他们难以接收最近转移患者的外部检测结果或病历叙述(Leonard 和 Tozzi 2012)。

英国在其国家医疗服务体系(NHS)方面提供了一个有益的对比,NHS是一个单一政府运营企业,能够在服务提供点提供免费医疗保健。目前,NHS能够成功整合多种健康记录—领先于美国—但其依赖的技术陈旧,存在安全性漏洞,例如传真机(Macaulay 2016)。最近,NHS也开始了医疗服务的数字化进程,各个NHS信托机构正在采用美国电子健康记录解决方案,例如剑桥郡NHS信托机构’最近与Epic达成的协议(Honeyman et al. 2016)。然而,NHS在所有服务中广泛使用和普及电子健康记录方面仍落后于美国(Wallace 2016)。此外,它还需要强制推行所采用的各种电子健康记录系统符合集中化标准和互操作性要求,以便将基因组测序等领域的服务添加到患者记录中。

错误的电子健康记录设计

另一个经常被指出的问题是,现代电子健康记录系统对医生在诊断方面往往没有帮助——并且已被主要临床医生指出是患者护理的障碍(Lenzer 2017; Gawande 2018)。当前一代电子健康记录系统的共同特点是其关注计费代码,即为医疗专业人员执行的每一项任务、服务和发放的药品分配的一组数字,用于确定医疗服务提供者将获得的报销水平。这种对计费代码的关注是美国保险体系的必然要求,该体系按服务收费向医疗服务提供者进行报销(Essin 2012; Lenzer 2017)。由于护理过程的每个环节都需要向保险公司(数量众多)甚至有时同时向多家保险公司进行计费,因此美国的电子健康记录系统在设计时首要考虑的是保险需求。因此,电子健康记录受到政府法规关于计费代码以及保险公司要求的限制,之后才能考虑医疗服务提供者或研究人员的需求(Bang 和 Baik 2019)。而且由于电子健康记录的采购决策并非由医师做出,因此患者护理结果的重要性排在其他需求之后。美国医学会已指出电子健康记录使用的困难是导致医生职业倦怠的因素之一,也是宝贵时间的浪费(Lenzer 2017;Gardner 等 2019)。英国国家医疗服务体系由于依赖美国制造商的电子健康记录系统,尽管其结构本质上不同,也不得不面临同样的问题。

与电子健康记录(EHR)系统优化用于计费而非患者护理相关的问题是,这些系统未能进一步发展成为诊断辅助工具。一项关于诊所中现代电子健康记录使用的研究所指出的医生和医疗团队的诸多痛点中(Assis-Hassid 等 et al. 2019),最突出的是诊所在使用电子健康记录方面存在差异—部分原因在于这些程序在设计时通常未充分考虑医疗服务提供者的工作流程(Assis-Hassid 等 et al. 2019)。此外,研究发现电子健康记录会干扰人际沟通,并且未能将护士、医师助理、实验室及其他服务提供者所产生的多种类型数据整合为医生可用的信息(Assis-Hassid 等 et al. 2019)。

数据所有权

当前大数据实施面临的主要挑战之一是缺乏管理数据所有权和数据责任的法规、激励措施和系统。在临床领域,美国的情况体现为遵守HIPAA(《健康保险可携性和责任法案》),这是一项已有十年历史的法律,旨在为患者隐私和数据控制制定规则(Adibuzzaman 等 2018)。随着为患者生成并上传至电子平台的数据类型日益增多,HIPAA已成为数据共享的重大障碍,因其引发了严重的隐私问题,阻碍了研究进展。如今,即使研究人员仅搜索简单的人口统计学信息和疾病状态—他们也可能迅速识别出原本已去标识化的患者(Adibuzzaman 等 2018)。对违反HIPAA的担忧导致无法达成全面而开放的数据共享协议—阻碍了实现下一代研究所需的特定条件,同时也干扰了这些技术在临床应用中的推进,因为数据共享被围绕旧法规和患者隐私的模糊性所拖累。此外,在欧盟遵守《通用数据保护条例》(GDPR)的规定也阻碍了国际合作,因为目前尚未实现HIPAA与GDPR合规要求的标准化(Rabesandratana 2019)。

数据共享由于需要开发新技术以整合多种服务提供者而变得更加复杂。以美国国立卫生研究院(NIH)资助、合作伙伴医疗(Partners Healthcare)支持的整合生物学与床旁信息学(i2b2)项目为例,在现有电子健康记录系统之上叠加程序既困难又极其昂贵(Adibuzzaman 等 2018)。相反,需要开发一种新方法来解决数据共享问题。区块链提供了一种创新方法,近期文献已探索将其作为解决方案,使患者能够控制自身数据,并通过加密保护的数据传输交易促进安全的数据共享(Gordon 和 Catalini 2018)。正在探索这种数据共享机制的公司包括星云基因组学fi由乔治·丘奇创立的公司,旨在通过区块链技术实现基因组数据的商业化规模安全存储,并且仅在获得数据所有者——即患者本人——许可的情况下用于研究目的—其他fi公司正在探索利用存储在区块链中的多种数据类型来构建疾病预测模型—例如 Doc.Ai—但这些应用都基于一个核心理念,即使用区块链来保障患者数据的安全性,并确保各站点之间私密且准确的医疗数据传输(Agbo 等 2019)。区块链在医疗保健数据传输和存储方面的优势在于其安全性和隐私保护,但该技术尚未得到广泛应用。

临床应用建议

设计新一代电子健康记录

可以预见,不久的将来,医生将面临太字节数据——患者前往诊所时携带多年的连续监测数据,包括心率、血糖以及多种其他因素(Topol 2019a)。期望医生从如此大量的数据中获得临床洞察是不现实的。为了解决检测、分析和结果数量激增的问题,电子健康记录不仅需要作为患者与医师互动的记录和数字文件夹,还需扩展为诊断辅助工具(图 1)。诸如罗氏–Flatiron 等公司已经在向这一模式迈进,将其提供的电子健康记录中集成预测与分析工具。然而,在多种服务提供者中的广泛采用——以及所生成模型的透明度和可移植性也至关重要。

示意图0

图1 大数据的前景在于其预防疾病的能力,而不仅仅是帮助医生诊断疾病。在此示例中,我们展示了如何整合多种可能因素,以更精准地确定需要进行早期筛查措施的患者,从而降低医疗系统的总成本。

模型的可审计性对于避免种族偏见和其他潜在风险至关重要(Char 等 2018)。患者很快会要求永久访问由机器学习模型生成的模型和预测,以更清楚地了解临床决策是如何做出的,并防范医疗过失。

设计下一代电子健康记录系统需要医生、患者、医疗服务提供者和保险公司之间的协作,以确保系统的易用性和效率。关于对英国国家医疗服务体系的具体建议,美国退伍军人事务部提供了一个富有成效的范例,其能够开发出自己的电子健康记录系统,且该系统与私营公司生产的Epic电子健康记录相比具有显著优势(Garber 等 2014)。该方案是开放获取的公共领域解决方案,并赢得了医生的忠诚,从而改善了患者护理(Garber 等 2014)。然而,退伍军人事务部的解决方案未能被积极采用,原因是缺乏持续维护的支持以及计费功能支持有限(Garber 等 2014)。尽管英国国家医疗服务体系无需考虑保险行业的意见,但它必须注意到,私营电子健康记录系统之所以能够在市场中占据主导地位,部分原因在于它们为医疗服务提供者提供了有力支持,并能更积极地回应个性化提出的问题(Garber 等 2014)。来自丹麦的证据表明,英国实施电子健康记录将受益于私营竞争对手在地区而非国家层面实施解决方案,以平衡竞争与标准化的需求(Kierkegaard 2013)。

开发新的电子健康记录工作流程

目前,研究人员和企业正在开发能够基于影像数据更准确诊断癌症的预测模型(Bibault 等 2016)。尽管这些产品和工具尚未准备好进入市场,也远未达到临床批准的标准——但它们预示着未来的方向。我们设想未来肿瘤科医生的工作将日益偏向解释性而非诊断性。但要实现这一未来,我们需要像培训未来的医生一样训练我们的算法——通过数百万个实例。为了构建这一数据语料库,我们需要围绕大数据建立数字基础设施,以同时满足研究人员和企业在持续改进其模型方面的需求——以及患者和医生在使用现有工具和知识继续开展重要工作时的需求。在图 2 中,我们展示了一个基于该领域其他研究人员提供的模型所构建的假设工作流程(Bibault 等 2016;Topol 2019a)。这一简化的工作流程将电子健康记录视为一种整合工具,可促进多种数据源的采集,并将其转换为标准化格式,存储于安全云存储设施中(Osong 等 2019)。

图2 设想的总体护理模型。在此模型中,各种异构数据类型被输入到一个集中化的电子健康记录系统,该系统将上传至安全的数字云,在云中可进行去标识化处理,并主要供医生和患者使用,同时也可用于研究和企业。

美国现行《健康保险可携性和责任法案》(HIPAA)的局限性阻碍了该领域的创新,因此改革必须同时保障患者隐私数据的保护以及下一代诊断工具对患者病史的开放获取。精确的预测模型在患者治疗中的引入意味着癌症诊断将发生根本性变化。我们将看到肿瘤科医生的工作随之转变,他们在平衡数字工具所提供的建议(这些工具可即时整合文献和既往患者的电子记录)与自身最佳临床判断之间发挥关键作用。

使用全球患者ID

尽管我们已经看到了数十年来机器学习方法研究的成果,但还有一整套新技术即将走出研究实验室并应用于临床。这套“组学”——通常指蛋白质组学、基因组学、代谢组学等——将在更低的成本下揭示患者癌症更详细的特征(Cho 2015)。然而,与其他技术一样,它们将产生拍字节级的数据,需要存储和整合以帮助医生。

随着检测项目和医疗服务提供者的多样化,电子健康记录将需要解决可扩展性和灵活性的问题。像咨询办公室和磁共振成像中心这样差异较大的医疗服务提供者,不可能被期望使用相同的软件,甚至类似的软件。当为不同类型的医疗服务提供者创建特定解决方案时,这些方案需要以标准格式与现有电子健康记录进行对接。英国生物样本库通过使用单一患者ID来链接多种数据类型,为这类交互提供了示范模型,使得在未来迭代和改进过程中能够方便地增加项目的数据来源。此外,

瑞典和中国在使用国家公民身份号码来关联临床和行政数据集方面提供了有益的范例(Cnudde 等 et al. 2016;Zhang 等 et al. 2018)。尽管《健康保险可携性和责任法案》HIPAA 中包含了建立单一患者ID的内容,但由于后续的国会行动阻止了其创建,美国目前尚未建立单一患者ID(Davis 2019)。取而代之的是,私营医疗服务提供者介入以弥补这一空白,但也呼吁美国政府建立官方的患者ID系统(Davis 2019)。单一患者ID不仅能使研究人员将美国的行政数据与临床结果相链接,还能为当前系统中存在的数据所有权和数据碎片化问题提供解决方案。

展望

医疗未来将建立在当前全球正在开拓的大数据项目基础之上。由“我们所有人”试验所推动的数据整合模式以及P4医学倡导的分析技术,将定义患者体验(Flores 等 et al. 2013)。然而,本文指出了一系列该领域必须克服的障碍,以避免给医生带来额外负担,并实现显著价值。我们提出了一套建议,基于对英国国家医疗服务体系及其他公共管理的医疗保健模式和美国多支付方体系的考察,旨在弥合发展这些新技术所需的市场竞争与有效的患者护理之间的差距。

患者数据访问必须成为监管机构着手解决已生成的大量数据流问题时的首要指导原则。数据既必须对医生和患者可访问,又必须经过加密和去标识化处理,以利于研究。英国生物样本库采取了一条通过建立单一数据库和访问协议来确保数据整合与普遍访问的路径(Allen 等,2012)。因此,对于已经集中化且具有单一资金来源的英国国家医疗服务体系,提出类似的系统是可行的。然而,由于该系统的集中化性质,即便患者数据已加密,仍必然存在安全问题(图 3)。

图3 患者数据保护的需求备受关注。未来大数据的实施不仅需要整合数据,还需要对数据进行加密和去标识化以实现安全存储。

另一种方法是效仿美国《健康保险可携性和责任法案》,该法案二十多年前就提出了创建唯一患者ID的建议。通过单一患者标识符,电子健康记录将能够与专为实验室、影像中心或咨询服务等设计的异构系统进行通信(图 4)。然而,这种设计的前提是在多种数据库之间实现标准化格式和通信协议——类似于已有的HL7标准(Bender 和 Sartipi,2013)。

无需由中央权威机构建立数字基础设施来存储和传输患者数据,通过强制规定协议和安全标准,即可推动为日益多样化的医疗服务提供者开发专用电子健康记录解决方案,并促进市场对这些系统的持续发展和支持。避免在美国已出现的数据碎片化问题,关键在于在法律上强制规定数据共享。

接下来的问题则是人工智能在医疗保健中不可避免的应用。任何创建的此类工具都将不得不接受严格的审查,而不仅仅是被要求超越人类诊断,还要揭示其方法。由于机器学习模型的不透明性,“黑箱”效应意味着外部观察者无法审查或理解这些诊断(图5)。这使得临床应用受到极大限制,除非开发出进一步的技术来解析这些模型的决策过程。在此之前,我们预计人工智能模型只能为诊断提供辅助支持。

图4 我们推荐的医疗系统模型。基于可在多种系统和医疗服务提供者之间通用的唯一患者标识符的假设性医疗系统设计——将不同的数据集整合为完整的患者档案。

图5 如果监管机构不够警惕,这种医疗保健模式可能会被实施,但这是不可取的。由于许多正在实施的模型缺乏透明度,无法解释决策的原因和方式,因此存在算法偏见的风险,且医生无法对其进行改进或批评。机器学习的“黑箱”特性掩盖了决策的原因以及实际影响预测的因素。

此外,人工智能模型往往只是复制了现有数据集中的偏见。Cohn 等 2017 年的研究显示,英国生物样本库中患者群体的少数群体代表性存在明显不足。这意味着,基于这些数据集开展的任何研究,所构建的模型只能适用于该数据集内的群体(主要是同质化的白人英国群体)(图6)。为了防范算法偏见,并防止当前模型以“黑箱”方式隐藏其决策过程,监管机构必须实施相关规定,使未来的预测性医疗保健模型的决策过程接受公众和医生的审查。类似于美国食品药品监督管理局现有的医疗器械监管框架,算法也必须接受监管审查,以防止歧视,同时确保医疗保健的透明度。

图6 目前整合多种因素的大规模实验中,少数群体代表性往往不足。“我们所有人”研究将通过专门致力于招募多样化的参与者来满足这一需求,以开发适用于每位公民的疾病模型,而不仅仅多数人群(Denny 等 2019)。未来全球大数据生成项目应借鉴此范例,以确保所有患者获得医疗公平。

医疗保健的未来将越来越多地存在于服务器机架上,并由程序员团队在玻璃办公楼中构建。美国必须认真对待集中化监管和协议所带来的优势,这些优势使英国国家医疗服务体系在防止数据碎片化问题上取得了巨大成功;而英国国家医疗服务体系则必须将医疗设备和技术更自由市场的可能性视为进入下一代医疗服务的必要条件,因为下一代医疗服务需要持续的革新和改进,以提供精准的诊疗服务。

总体而言,我们正在进入一个关于患者护理和医师角色的转型期。大数据使我们有机会优化筛查和预防协议,从而显著降低晚期癌症和转移等疾病的负担,而不是建立一个等到癌症发展到严重阶段才发现的被动医疗系统。这一发展使得医生在制定治疗方案时,能够更多地从个体患者的角度出发,利用超出粗略人口统计学指标的信息,例如肿瘤的基因组测序。目前,医疗系统尚未为此转变做好充分准备,因此世界各国政府有责任关注彼此在医疗保健中应用大数据的方式,共同构建未来的监管框架。确保竞争性、数据安全性和算法透明度,将成为我们保障更优质患者护理的核心要素。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐