AI医疗临床2026-08-17 13:12

治愈率95%的丙肝,3000万人正悄悄走向肝癌:OpenAI投1亿美元,寻找"失踪的病人"!

智医界研究院
治愈率95%的丙肝,3000万人正悄悄走向肝癌:OpenAI投1亿美元,寻找"失踪的病人"!

一个事实:丙肝吃8—12周药就能治愈,治愈率超过95%——但全球约4700万现存感染者中,只有36%(约1700万人)知道自己病了。

一个边界:AI找不到病毒的新药,也替代不了医生。它真正能做、且已经在做的,是从医保数据和病历里把”失踪的患者”一个个找回来。

一个判断:未来五年,AI医疗最先兑现价值的地方,大概率不是”发明新药”,而是”把已有治愈方案送到该吃的人手上”——丙肝正在成为全球第一个试验场。

如果你好奇AI怎么完成这场”寻人行动”,以及它在中国会遇到什么不一样的难题,下面的综述会告诉你答案。

摘要

丙型肝炎病毒(HCV)感染是全球重大公共卫生问题。尽管直接抗病毒药物(DAA)已使丙肝成为治愈率超过95%的可治愈疾病,但截至2024年,全球约4700万现存感染者中仅36%知晓自身诊断,累计接受DAA治疗者仅约1300万人(截至2024年底),与世界卫生组织(WHO)2030年消除目标(90%诊断、80%治疗)存在巨大缺口。

本文以2020—2026年间国内外公开研究与项目为对象,系统梳理人工智能(AI)在丙肝防治全链条中的应用演进:从基于医保索赔数据的机器学习病例发现模型(精确度达97%),到英国NHS(公立医疗系统,相当于中国的卫健委)的全国性AI患者寻找计划。从常规检验数据驱动的辅助诊断与治愈后肝癌风险预测,到检索增强生成(RAG)大语言模型将丙肝指南解读准确率从43%提升至99%;再到2026年OpenAI基金会投入1亿美元、以”治愈率翻倍”为目标的Breakthroughs to Follow-Through(从突破到落实)项目。

研究表明,AI在丙肝领域的价值重心正从”发现新知”转向”弥合执行鸿沟”,但数据质量、模型可解释性、隐私伦理与效果验证仍是制约其规模化落地的关键瓶颈。本文同时讨论了中国丙肝消除的政策进展与AI落地的现实路径。

关键词:丙型肝炎病毒;人工智能;机器学习;大语言模型;检索增强生成;病例发现;消除目标;临床决策支持

一、引言:一种”可治愈”疾病的未竟之局

丙型肝炎是医学史上少有的”技术问题已解决、执行问题未解决”的疾病样本。自2014年起,口服直接抗病毒药物(DAA)已可使超过95%的患者在8—12周疗程内获得治愈,但感染本身长期无症状、筛查依从性低、治疗链条断裂,使大量患者从未进入或中途掉出诊疗体系。

WHO于2016年提出到2030年将病毒性肝炎作为公共卫生威胁消除的目标——新发感染较2015年下降90%、相关死亡下降65%,对应的覆盖目标是90%的感染者获得诊断、80%的确诊者获得治疗(Coalition for Global Hepatitis Elimination)。

然而现实进展远落后于时间表:据WHO和美国CDC(疾控中心)汇总数据,2024年全球约4700万人现存HCV感染,其中仅约36%知晓自身感染状态(CDC);2015—2024年累计仅约1300万人接受了DAA治疗(WHO)。全球消除肝炎联盟(CGHE)2025年发表于《柳叶刀·胃肠病学与肝病学》的33国评估显示,不到30%的国家达到诊断目标、不到15%的国家达到治疗目标(Coalition for Global Hepatitis Elimination)。

图片

全球丙肝诊疗链与WHO目标的差距

图1 全球丙肝诊疗级联(数据来源:WHO《Global Hepatitis Report 2026》及WHO丙肝实况报道,2026年7月更新)

正是在这一”高治愈率、低到达率”的结构性矛盾中,人工智能找到了介入空间。过去六年间,AI在丙肝领域的应用沿诊疗链条不断延伸:上游用机器学习从海量健康数据中”找回”未确诊者,中游用大模型弥合指南知识与临床实践之间的落差,下游则用智能代理追踪治疗完成度。

本文基于2020—2026年间的代表性研究与项目,按”患者发现—诊断与风险评估—指南与决策支持—治疗交付”四个层次展开综述,并讨论其局限与中国语境下的落地路径。

二、患者发现:AI破解”失踪的数百万”难题

1、从风险因素筛查到机器学习预测:Doyle模型的范式意义

丙肝筛查长期依赖基于风险因素或出生队列的粗放策略。美国CDC曾建议对1945—1965年出生人群进行普遍筛查,但该队列的HCV感染率估计仅约2.23%,意味着每筛查100人仅有约2人是真正的感染者,成本效益低下(Nature)。2020年,IQVIA的Doyle团队发表于《Scientific Reports》的研究提供了范式级的替代方案:他们利用美国2010—2016年间约1000万患者的纵向医疗索赔与处方数据,训练逻辑回归、随机森林、梯度提升树(GBT)及堆叠集成模型,从人口学特征、风险因素、症状、治疗和操作记录中提取特征以识别未确诊的HCV感染者(PubMed)。

该研究的关键发现有三个层次。

其一,模型揭示的患者画像具有清晰的临床合理性:年龄(50—60岁风险最高)、静脉注射毒品史(年注射10次及以上者感染可能性增加约4倍)、非甾体抗炎药(NSAIDs)处方和疼痛治疗均位居预测贡献度前十,且患者在确诊前2—3年即出现关节痛、腹痛、疲劳等已知症状,确诊前数年即开始接受NSAIDs或阿片类药物治疗——这意味着AI捕捉到的”诊断前轨迹”可将诊断窗口前移数年(PubMed)。

其二,性能上形成对传统筛查的数量级超越:在50%召回水平下,堆叠集成模型精确度达97%(GBT为87%,逻辑回归仅31%),即模型标记的每100人中约97人将被确诊,较出生队列筛查2.23%的阳性率提升逾40倍(PubMed)。

其三,时间特征的工程化处理(加入事件发生时间信息后,50%召回下的精确度从74%升至87%)证明了纵向数据的增量价值(Nature)。该研究随后在《BMJ Health & Care Informatics》的独立验证中进一步确认了机器学习路径的筛查效率:要找出48.4%的未确诊患者,出生队列法需筛查34.5%的人群(精确度0.03%),而ML算法仅需筛查12.3%的人群即可达到相同捕获率(bmj.com)。

图片

AI筛查模型与传统策略的精确度对比

图2 AI筛查模型与传统出生队列筛查的效率对比(数据来源:Doyle et al., Scientific Reports, 2020)

2、从模型到国家行动:英国NHS的AI患者寻找计划

学术研究向公共卫生实践的转化以英国最为典型。2022年夏,NHS英格兰宣布AI筛查计划(媒体于7月报道,官方口径为同年9月启动):利用患者搜索识别(PSI)软件扫描全科诊疗档案,自动识别具有历史输血史、HIV诊断等关键风险因素的高危个体,由GP邀请其复诊并接受HCV检测,阳性者进入NHS与三家药企签订的抗病毒治疗通道(Nursing In Practice)。NHS英格兰丙肝消除项目国家临床主席Graham Foster教授称此举为”消除病毒斗争中的重要一步”,有望”挽救数千人的生命”(Nursing In Practice)。

这一计划的成效需置于英国整体消除战略的框架中评估。依托近10亿英镑的五年药品采购协议与”寻找—治疗”(find and treat)外展项目,英格兰丙肝相关死亡(含肝病与肝癌)在2015年后下降了35%;肝移植等候登记降至原来的三分之一以下(年登记从140余例降至2020年不足50例);累计约7万人获治愈。NHS官方宣称有望在2025年前后成为全球首个消除丙肝的国家,比WHO目标提前五年(NHS England,2022年12月)。

值得注意的是,AI筛查在其中扮演的并非独立角色,而是嵌入”药品可及+数据找人+社区外展”的组合拳——这一经验提示,算法的价值只有在服务体系就位时才能兑现。

3、低成本路径:常规检验数据与急诊场景的AI化

并非所有地区都具备英国式的数据基础设施,一批研究探索了更低门槛的AI辅助发现路径。西班牙2025年上线的Intelligen-C系统做了两件事。

第一件,翻旧账:把2013到2021年的病历翻了一遍,找回272名"失踪"的丙肝感染者——这些人抗体或病毒检测曾经阳性,但后续没再露面。

第二件,自动筛:2022年起,系统在急诊和住院部后台自动运行,40—70岁的患者进门就默认扫一遍,遇到高危因素再额外触发检测。结果很直观:两年做了7312次血清学检测,捞出28名真正的病毒携带者;和之前"靠医生想起来才开单"的阶段比,检测量翻了8倍(7312对909),真阳性检出翻了9倍(28对3),最终吃上药的从1人涨到9人。算下来,这笔钱花得值。

另一类研究则尝试仅凭常规、廉价的血液检验数据预测丙肝:基于UCI(UCI机器学习库)数据集的六种机器学习算法比较显示,AdaBoost(让低阶医生们互相补短板,最后凑成一个专家团的强化学习系统)取得97.8%的准确率与0.994的AUC(衡量模型把"有病"和"没病"分开的能力,越接近1分得越准)。

一项覆盖179名丙肝抗体(抗-HCV)阳性者的研究,把抗体定量值和ALT(谷丙转氨酶)、AST(谷草转氨酶)、GGT(γ-谷氨酰转肽酶)等常规肝功指标一起喂给AI建模,发现这些指标和感染风险不是简单的"越高越危险",而是存在"过了某个门槛才陡然升高"的阈值效应。模型准确度(AUC,越接近1越准)达到0.977,几乎满分——这意味着抗体初筛阳性后,AI可以先筛一道,把大概率真感染的人送去核酸检测,其他人不必花冤枉钱做核酸。

这些研究共同说明:AI省下的不只是检查费,更省掉了"谁去推动筛查"这个最难的环节。以前靠医生主动想起来开单,现在系统后台自动扫数据、自动标记高危者,筛查从"人找病"变成了"病找人"。

表1 2020—2026年AI用于丙肝患者发现与筛查的代表性研究/项目

图片

三、诊断与风险评估:从纤维化分期到治愈后的肝癌预警

1、疾病进展与纤维化的无创评估

这一节讨论的指标——血小板、转氨酶、胆红素——都是你体检报告上印着的项目。AI在这里做的事,本质上是从这些常规数字里读出”肝脏正在悄悄变硬”的信号。

丙肝的危害在于其向肝硬化、肝细胞癌(HCC)的隐匿演进,而传统评估手段各有短板:血清学指标特异性不足,超声依赖操作者经验,肝活检则有创且存在取样误差。

而机器学习为无创分层提供了新工具。在慢性HCV人群中,已有研究使用粒子群优化与交替决策树预测进展期肝纤维化(准确率84.4%)、用决策树对纤维化进行分期(93.7%)、用XGBoost预测HCV疾病进展(91.56%)(ACM Digital Library)。

2025年发表于《Scientific Reports》的一项系统比较在UCI肝炎数据集(155例)上评估了七种机器学习模型,随机森林综合性能最优(准确率92.42%、灵敏度95.24%),Boruta特征选择算法可将高维检验指标压缩至少数关键预测因子,兼顾性能与可解释性(Nature)。需要说明的是,该数据集规模小、任务为肝炎患者生存预后而非专门的丙肝纤维化分期——此类高性能数字提示潜力,但向临床外推仍需谨慎。

2026年1月发表于《npj Gut and Liver》的爱丁堡大学Morel团队综述《人工智能在肝病学中的机遇与挑战》将这些工作置于更大的图景中:基于卷积神经网络的深度学习可在CT/MRI图像中识别肉眼不可见的纹理微变以预测纤维化程度,自然语言处理可从非结构化病历中提取风险因素,多组学整合模型则能在分子层面捕捉疾病信号(Nature)。尽管该综述覆盖全肝病谱系而非仅限丙肝,其方法论判断——AI正在把肝病诊疗从”发现即晚期”的被动模式推向主动预防——对丙肝尤其贴切,因为丙肝恰是”隐匿感染—晚期发现”模式最典型的病种之一。

2、治愈不等于终点:SVR后肝癌风险的AI分层

DAA时代的临床难题之一是:获得持续病毒学应答(SVR)即”治愈”后,部分患者——尤其是治疗前已存在进展期纤维化或肝硬化者——仍有HCC发生风险,但各大学会、指南对SVR后监测的目标人群与间隔存在分歧(Gut and Liver)。

传统静态分期难以刻画个体化风险轨迹,AI模型由此介入。

Nakahara团队2024年发了一个AI模型,专门预测丙肝患者"治愈"后还会不会得肝癌。输入数据全是体检单上的常规项——血小板、γ-GTP(γ-谷氨酰转肽酶)、性别、年龄、ALT(谷丙转氨酶)——模型用的是随机生存森林(RSF,一种专门预测"多久后出事"的机器学习算法)。结果发现:现行指南按固定数值一刀切,把不少人划进"低风险"区不用勤查,但他们后来还是得了肝癌。AI的分层更细,能揪出这些"指南漏网之鱼"。作者还把代码和数据全开源在GitHub上,变量故意选得少而常见,基层医院也能用。

传统方法什么水平?一项汇总了27项研究、近17万患者的Meta分析给了答案:治疗前用VCTE(振动控制瞬时弹性成像,一种无创测肝硬度的仪器,正常值参考9.2—13 kPa)预测的准确度(AUC,越接近1越准)为0.79,FIB-4(一种用年龄和血液指标算的肝纤维化评分,>3.25为异常)只有0.73;治愈后再测,表现还会更差。

两相对比,AI把多个常规指标拧成一股绳、处理它们之间复杂的非线性关系,确实比单看一个指标要强。但要泼一点冷水:目前这些漂亮数据大多是"翻旧病历"算出来的,真正在临床上先跑模型、再跟踪患者的前瞻性验证还很少。AI能算准旧账,不等于能算准未来。

四、大语言模型登场:弥合指南与临床之间的”遵循率鸿沟”

1、问题的提出:指南很好,遵循很差

丙肝管理的另一个深层矛盾在于:指南成熟而遵循率低。既有研究报道,丙肝筛查和管理的指南遵循率仅在36%—54%之间(Kresevic, Giuffrè等,npj Digital Medicine),这意味着即便患者进入医疗体系,也有近半数未能获得指南推荐的标准处置。

2023年后大语言模型(LLM)的爆发为这一”知识交付”问题提供了新工具,但裸模型的表现首先泼了一盆冷水:Kresevic、Giuffrè等2024年发表于《npj Digital Medicine》的研究显示,直接使用GPT-4 Turbo回答丙肝指南相关问题,总体准确率仅43%——其中文本类问题62%、表格类问题28%、临床场景类问题仅20%(npj Digital Medicine)。

这一结果与同期其他研究相互印证:在消化肝病领域查询通用LLM的研究中,准确率分布跨度极大(6.4%—91.4%),提示裸模型的医学知识既不完整也不可靠(University of Trieste - Arts and Humanities Research Portal)。

2、RAG框架:从43%到99%的消融实验

这项研究回答了一个关键问题:怎么让通用大模型(LLM)安全地给医生当参谋?

他们拿欧洲肝病学会(EASL)2020年丙肝治疗指南当知识库,做了一轮"剥洋葱"式的实验——也就是消融实验:每加一层优化,就测一次准确率,看看到底哪一步最值钱。

结果像爬楼梯:

图片

个关键发现:

  • 文本重格式化比堆数据更重要:准确率从43%飙到99%,主要靠"把指南整理干净、标清楚",而不是塞更多例子。54组问答对扔进去,一分没涨——说明模型本身够聪明,缺的是高质量的知识库,不是更多的示范。
  • 表格是裸模型的死穴:GPT-4直接读指南里的图片表格,准确率只有16%。把表格转成文字列表,是性能跃升的关键一跃。医学指南高度依赖表格呈现核心推荐,这个发现对所有"大模型读指南"的场景都管用。
  • 幻觉被压到几乎清零:随着优化逐级推进,胡说八道的次数从57次降到1次。

分类成绩单:

  • 纯文字类问题:100%
  • 读表格类问题:96%
  • 模拟临床场景类问题:100%

全部显著优于裸模型(p<0.001,统计学上极靠谱)。

图片

RAG消融实验准确率阶梯

图3 RAG消融实验:指南结构化重格式化与提示工程的逐级贡献(数据来源:Kresevic, Giuffrè et al., npj Digital Medicine, 2024)

该研究的方法论启示超越了丙肝本身。

第一,数据质量重于数据数量:准确率的跃升主要来自指南的结构化重格式化与提示工程,而非堆砌更多示例,少样本学习的无效提示模型零样本能力已相当强。

第二,非文本信息是通用LLM的固有短板:GPT-4 Turbo从指南图像表格中提取信息的准确率仅16%,表格转文本列表成为性能跃升的关键节点——考虑到医学指南高度依赖表格呈现核心推荐,这一发现对所有”LLM+指南”应用都有直接指导意义。

第三,幻觉可被工程化压缩:随着优化逐级推进,幻觉总数从基线的57例降至最终框架的1例,且输入冲突型幻觉被完全消除,残留的仅为少量事实冲突型幻觉,全程未出现上下文冲突型幻觉。

第四,评估范式的警钟:BLEU、ROUGE、METEOR等文本相似度指标与专家评定的事实准确性之间并无稳定对应关系——措辞相似的答案可能事实错误,措辞不同的答案可能完全正确,这意味着医疗LLM的评估必须保留”人在回路”的专家核查,自动评分尚不能替代(npj Digital Medicine)。

3、从解读到开方:RAG与微调的疗效比较

同一团队2025年在《Liver International》(《国际肝病学》)上更进一步:让LLM(大语言模型,Large Language Model)直接给病人开DAA(直接抗病毒药物,Direct-Acting Antiviral)方案,它靠不靠谱?

他们测试了四种配置:

图片

两个关键发现:

第一,检索范围越宽越准。RAG-Top10(检索10条相关指南上下文)全面碾压RAG-Top1(只检索1条)——说明给模型的"参考资料"不能太少,窄检索容易漏掉关键约束条件。

第二,在真实临床场景中,RAG比微调更务实。 模拟25个真实病例的方案选择,RAG-Top10有76%的场景与四位肝病专家共识完全一致,而SFT(监督微调)只有66%。原因在于:临床决策不是背答案,而是综合患者合并症、用药史、耐药情况等多条信息做推理——RAG让模型实时查指南,微调只是让模型死记硬背。对基层医院来说,搞RAG(搭个知识库)比搞SFT(持续训练模型)便宜得多、可行得多。

另一条独立证据来自乙肝: Siepmann等发现,WHO(世界卫生组织,World Health Organization)新版慢乙肝指南刚发布几天,GPT-4裸模型的治疗推荐与新指南一致率仅51%,接入指南上下文后飙升到91%,措辞精确性、信息完整性同步改善。

丙肝+乙肝,两条线交汇成一个结论: 大模型治病靠不靠谱,不取决于它有多少亿参数,而取决于回答问题时有没有被"锚定"在权威指南上。没有知识库兜底的聪明,只是聪明的胡说。

表2 大语言模型在丙肝相关任务中的表现汇总

图片

4、 患者教育场景:可用,但远非可靠

如果说给医生用的AI已经接近"优等生",那给患者用的AI只能算"勉强及格"——而患者端的容错空间,其实比医生端小得多。

第一层证据:176题大考

2025年一项研究给ChatGPT和Gemini(谷歌的大模型)出了一套176题的病毒性肝炎考卷,分三个难度:

图片

丙肝专项题的完全正确率倒是都有70.3%,但这只是"及格线",离"放心交给患者看"还差得远。

第二层证据:四大模型盲评

另一项研究更贴近真实场景:让ChatGPT-4o、Gemini 2.0 Pro、Claude 3.5 Sonnet、DeepSeek V3回答12道患者真正会问的问题——从"我会不会传染给家人"到"确诊要做什么检查"。五位肝病专家背靠背打分,满分6分:

  • 准确性:最高5.17分(Gemini),最低4.17分(DeepSeek)。换算成百分制,大约70-86分,算"基本没胡说"。
  • 完整性与可理解性:普遍只到"及格"水平。模型要么漏掉关键步骤,要么堆砌术语。
  • 最致命的短板:不懂患者在怕什么。

评委特别指出:当患者问"我怀疑自己感染了丙肝,该做什么"时,AI会长篇大论讲病毒复制原理、肝脏炎症机制——但患者真正想知道的是:去哪里挂号?抽血要不要空腹?几天出结果?准确率多高?多少钱? 这些"实操信息"模型往往一笔带过。至于安抚焦虑、解释"即使确诊也有药可治",更是浮于表面。

一句话总结:

AI当科普读物(CDC类问题)基本合格;当用药参谋(治疗推荐)错误率高到不敢用;当陪诊对话(理解焦虑、讲清流程)则完全不合格。RAG(检索增强生成)能把医生端的准确率拉到99%,但患者端需要的不仅是"事实对",还要"说得清""懂人心"——这条路,还没打通。

图片

主流大模型丙肝患者教育问答评分

图4 四大主流LLM丙肝患者教育问答的专家盲评准确性均分(数据来源:PMC12872381,2025)

五、范式转移:从”AI发现疾病”到”AI完成治疗”

1、1亿美元的押注:B2F项目重新定义AI医疗的产出指标

2026年8月13日,Common Health Coalition(是一家美国医疗健康领域的跨行业协作组织)宣布获得OpenAI基金会1亿美元资助,启动Breakthroughs to Follow-Through(B2F:从突破到落实)项目:首批在阿拉巴马、伊利诺伊、路易斯安那、马萨诸塞四州落地,计划扩展至8个州和地方辖区,目标是在两年内将参与地区的丙肝治愈率至少提高一倍,随后将同一AI基础设施扩展至HIV预防和可治愈癌症(DistilINFO Publications)。Common Health Coalition由AHA、AMA、AHIP、Kaiser Permanente等于2023年共同发起,成员已超过400家机构;项目主席Dave Chokshi曾任纽约市卫生局长,主导过覆盖逾600万市民的疫苗接种体系(DistilINFO Publications)。

B2F的标志性意义不在于技术新颖,而在于任务定义的转变:AI在这里不负责发现新分子,也不替医生下诊断,而是从分散在实验室结果、电子病历、保险记录和扫描PDF中的数据里识别”掉出治疗链条”的患者,汇总病历、追踪进度、确定外联优先级,把有限的人力投向最需要干预的人(Fierce Healthcare)。

这一转向有冷峻的流行病学依据。CDC明确记载,安全有效的DAA自2014年起即可用,8—12周口服疗程治愈率超过95%;但美国仍有约三分之二的丙肝感染者未获治疗(DistilINFO Publications),CDC估计2024年仍有超过1万美国人死于丙肝——约合每天27人(CDC)。CDC基于Quest Diagnostics数据的州级分析显示,2013—2022年初次感染者中后续确认治愈或病毒清除的比例中位数仅29%。CDC 2026年5月公布的药物经济学研究则算清了这笔账:一次DAA治疗约2.5万美元,而治愈一名患者平均可节省65841美元的终身直接医疗费用;即便按220万感染者的保守估计,全部治愈的潜在终身直接医疗成本节省可达1470亿美元(CDC)。换言之,阻碍治愈的不是医学而是交付——这正是AI边际成本最低、最易规模化的环节。

2、商业与公益两条路线的对照

相关资料显示,B2F与商业医疗AI公司形成了有意思的对照:同样瞄准“没人给患者打该打的电话”,Hippocratic AI走企业软件路线,其AI代理已用于预约、出院随访、慢病检查和医疗缺口提醒,Universal Health Services在两家医院试点后扩展部署,该公司2025年11月完成1.26亿美元C轮融资、估值35亿美元;B2F则使用慈善资本,把州卫生部门、医院、社区机构与技术方组织到同一结果目标之下,不以软件订阅为收入模式。

前者的核心资产是客户合同与嵌入的工作流,后者的核心资产是跨机构数据协作与公共卫生执行能力。两条路线解决相似的人力短缺,却为”AI医疗的价值计量”提供了两种答案:按调用量收费,还是按治愈率结算。

B2F的成败将产生超出一个项目的外溢效应。如果两年后参与地区治愈率确实翻倍,医院和公共支付方将获得一个比”模型很聪明”更容易计算的采购理由——投入多少追踪与导航成本,就能减少多少失访、并发症与后续医疗支出;如果结果不佳,问题也会暴露得更清楚:究竟是模型找错了人,还是数据授权、支付、交通、语言与社区信任仍然挡在算法之外。未来12个月最值得关注的不是模型参数,而是四州如何接入工具、多少患者被成功重新联系、多少人进入并完成疗程,以及不同人群间是否出现获益差异。

六、 中国语境:政策框架已就位,AI的切口在哪里

1、缺口有多大?

中国是全球丙肝负担最重的国家之一,但绝大多数感染者"隐身"了。Polaris Observatory(一家追踪全球肝炎数据的机构)估计,2019年中国丙肝诊断率约30%,治疗率仅约9%——十个人里只有三个人知道自己病了,不到一个人吃上药。全球消除肝炎联盟(CGHE) 更新的口径更保守:2020年诊断率25%,2022年治疗率12%。

两组数字来源和年份不同,但指向同一个结论:诊断和治疗缺口巨大。 WHO定的目标是90%诊断、80%治疗,中国还差得远。

2、政策在补,但补到哪了?

好消息是,药的问题基本解决了。截至2022年初,多款DAA(直接抗病毒药物)已通过国家医保谈判进目录,国产药把价格打了下来,患者自付障碍大幅降低。微消除策略的目标人群也已圈定:注射吸毒者、血液透析患者、HIV合并感染者、育龄女性、孕妇及儿童——这些人是"先抓重点"的突破口。

建模研究算过一笔账:优先给高危人群做扩大筛查和治疗,每多花约1.17万美元,就能多换回一个"高质量寿命年"(QALY,质量调整生命年),能让慢性丙肝病例减少67%;即便拖到2025年才搞全民筛查,这笔账依然划算(每QALY约1.71万美元)。

但《柳叶刀·公共卫生》2025年泼了冷水:中国距离90%诊断、80%治疗的消除目标,仍有相当距离。更尴尬的是,中国至今没有全国性的丙肝检测与治疗监测系统,只有天津等个别地区在报定点医院的DAA治疗数据——全国到底有多少人治了、治得怎么样,底数不清。

3、地方样本:广州做了什么?

广州提供了一个可参照的基层实践。2024年广州市卫健委答复政协提案时披露:

(1)全市已出台病毒性肝炎患者全程管理操作指引

(2)推进医防融合(医院和疾控联手,而不是各干各的)

(3)对筛查、检测、转介、治疗、随访实施全流程管理

(4)把有能力的医疗机构纳入定点治疗医院

(4)定期对各区督促指导、质量评估

简单说就是:政策框架有了,流程图画好了,但跑起来靠人。

4、AI在中国能切哪里?

国内不缺"全程管理"的政策目标,缺的是让政策自动跑起来的工具。美国B2F项目的核心启示不是"技术多先进",而是用AI把跨机构追人、读病历、排优先级、反复打电话确认这些脏活累活,从人手里接过来。

中国的优势在于:统一健康信息平台、互联网医院、基层医疗网络理论上比美国碎片化的大数据拼接更顺畅。但几道坎必须先过:

图片

更关键的是:不能只做"AI外呼机器人"。 如果AI读不懂连续病历、连不上预约系统、遇到复杂情况不能转给真人,那就是个更便宜的呼叫中心,不是医疗AI。

真正的先行切口在这些地方:

·血液透析中心——患者固定、高频就诊、数据闭环

·戒毒维持治疗门诊——人群集中、随访刚需

·监狱系统——管理封闭、筛查可控

·HIV诊疗机构——合并感染率高、已有随访体系

这些场景的共同点是:人在哪、数据在哪、管理责任在哪,三件事在同一个闭环里。 AI在这里找人、追踪、提醒,不需要跨七八个部门拼数据,落地条件最成熟,也最可能先跑通"中国版B2F"。

七、AI落地前的七道坎

在AI丙肝领域看着热闹,但想大规模落地,有七道坎要过

第一道坎:数据本身带"病"

现在的AI模型大多是翻旧病历训练出来的——单家医院、回顾性数据。这带来两个问题:

  • 过拟合:模型像"考前刷题"一样把自家医院的病历背熟了,换家医院就懵。
  • 放大偏见:训练数据里如果缺少穷人、少数族裔、女性的完整记录,AI就会误以为这些人"风险低",反而漏掉他们。

最典型的例子是Doyle模型。它把"静脉注射毒品史"当作强预测特征,但医保系统对富人和穷人的病历记录完整度本就不一样——穷人可能更少去正规医院、更少留下索赔编码。算法没 discriminant(歧视),但它吃进去的数据自带社会不平等的烙印

第二道坎:医生不敢信"黑箱"

现在有了SHAP(SHapley Additive exPlanations,一种解释AI决策的技术)这类工具,能告诉医生"AI为什么判这个人高危"——比如年龄贡献了30%、血小板低贡献了25%。但真到了要打电话召回患者、或者推荐治疗方案的时候,"黑箱"焦虑依然真实:万一AI错了,谁向患者交代?

可解释性技术能"翻译"AI的逻辑,却治不好医生的信任焦虑。

第三道坎:评AI好坏,没有统一尺子

医疗AI的评估方法严重滞后。现在常用的BLEU、ROUGE、METEOR都是文本相似度指标——看AI说的和参考答案措辞像不像。但医学里,措辞像不代表事实对,措辞不同也可能完全正确。

结果是:医疗AI缺乏公认的效果度量体系。要评一个模型靠不靠谱,目前只能靠专家人工逐条审,根本扩不大、也复用不了。

第四道坎:出了事,谁担责?

法律还没跟上技术。欧盟刚出台《AI法案》,美国FDA才开始搞预定变更控制计划(Predetermined Change Control Plan,允许AI在预设参数内自动更新而不必重新审批)。但如果AI辅助召回的患者出了事、或者推荐的治疗方案有误,责任算谁的?医院?算法公司?还是主治医生?现在没有答案。

第五道坎:医生会变"废"

一个容易被忽视的风险叫去技能化。有研究发现,长期依赖AI辅助做肠镜的医生,一旦关掉AI,自己找息肉的能力反而下降了。

这提醒一件事:AI只能是"副驾驶",不能替医生开车。一旦养成依赖,人的基本功会退化。

第六道坎:AI itself 不环保

训练一次大语言模型消耗的电力和碳排放惊人。医疗系统一边喊"绿色低碳",一边跑耗电巨兽,这本身就有张力。

第七道坎:中国特有的"数据合规"门槛

对中国来说,还有一道独有的坎:病历能不能跨医院调?AI自动给患者打电话,要不要先征得同意?告知书怎么写?

个人健康信息的跨机构调用、自动化外联的授权基础与告知机制——这些没厘清之前,任何"AI找人—追踪—治疗"的系统在法律上都还是灰色地带。这是落地前必须跨过的门槛。

八、结论

回望2020—2026年,AI与丙肝的交汇呈现清晰的三段式演进:

第一阶段(2020—2022),机器学习证明了从常规健康数据中精准识别未确诊感染者的可行性,并经英国NHS转化为国家级筛查行动;

第二阶段(2023—2025),大语言模型在丙肝指南解读上经历了从”43%不可用”到”99%接近完美”的跃迁,RAG与结构化重格式化成为医疗LLM安全接入的标准路径,同时患者教育场景暴露出裸模型在治疗知识与共情沟通上的双重短板;

第三阶段(2026年开启),以B2F项目为标志,AI的任务定义从”更聪明的模型”转向”更高的治愈率”,评价标准从准确率变为治疗完成率。

这条演进线的底层逻辑是一以贯之的:丙肝的医学难题早已解决,剩下的全是系统性执行难题——而AI最擅长的恰恰是把依赖人力的、重复的、跨系统的执行环节压缩到更低的边际成本。

当然,算法可以把名单缩小,却不能替代最后那层信任;模型能算出谁掉队了,但让人回来完成治疗,仍需数据、支付、组织与人文关怀的共同就位。对志在2030年消除丙肝的世界而言,AI不是答案本身,而是让已有答案真正抵达患者的那座桥。

【评论区聊聊】你觉得AI消除丙肝的关键一环,会是像NHS那样翻医保数据把人找出来,还是医院里AI提醒医生多开一张检测单?

免责声明:本文内容仅供学术与信息参考,不构成医疗建议、诊断或治疗方案。丙型肝炎的筛查、诊断与治疗请遵循专业医疗机构与执业医师的指导。

本文信源清单

一手/官方来源(S级)

  1. WHO《Global Hepatitis Report 2026》及丙肝实况报道(2026年7月更新):https://www.who.int/news-room/fact-sheets/detail/hepatitis-c
  1. CDC全球丙肝数据页:https://www.cdc.gov/hepatitis/global/index.html
  1. CDC丙肝治疗药物经济学(2026年5月):https://www.cdc.gov/nchhstp/whats-new/hepatitis-c-treatment-saves.html
  1. NHS英格兰《NHS set to eliminate hepatitis C ahead of rest of the world》(2022年12月):https://www.england.nhs.uk/2022/12/nhs-set-to-eliminate-hepatitis-c-ahead-of-rest-of-the-world/
  1. CGHE中国丙肝消除国家档案(2025年8月版):https://www.globalhep.org/sites/default/files/content/national_profiles/files/2025-08/2025-08-14_National%20Hepatitis%20Elimination%20Profile_China.pdf
  1. CGHE全球消除进展33国评估:https://www.globalhep.org/projects-research/global-progress-toward-hepatitis-elimination-new-reports-now-available
  1. 广州市卫健委《对市政协十四届三次会议第4141号提案答复的函》(穗卫复案〔2024〕194号):http://wjw.gz.gov.cn/xxgk/jytablgz/szxtabljggk/content/post_9845727.html

同行评议研究(S级)

  1. Doyle et al., Scientific Reports (2020),机器学习病例发现:https://pubmed.ncbi.nlm.nih.gov/32601354/ ;https://www.nature.com/articles/s41598-020-67013-6
  1. Rigg et al., BMJ Health & Care Informatics (2023),独立验证:https://informatics.bmj.com/content/bmjhci/30/1/e100651.full.pdf
  1. Intelligen-C策略,Gastroenterología y Hepatología (2025):https://www.elsevier.es/es-revista-gastroenterologia-hepatologia-14-articulo-the-efficiency-artificial-intelligence-for-S0210570525000275
  1. Wang et al., ACM ISAIMS (2023),UCI数据集六种算法比较:https://dl.acm.org/doi/fullHtml/10.1145/3644116.3644176
  1. 抗-HCV+生化整合模型(179例,AUC 0.977):https://pmc.ncbi.nlm.nih.gov/articles/PMC12351608/
  1. Khatun et al., Scientific Reports (2025),七种模型与Boruta特征选择(UCI肝炎数据集155例):https://www.nature.com/articles/s41598-025-07104-4
  1. Morel et al., npj Gut and Liver (2026),AI肝病学综述:https://www.nature.com/articles/s44355-025-00052-w
  1. Nakahara et al., JCO Clinical Cancer Informatics (2024),RSF模型(代码开源):https://github.com/hnakahara/SVR_RSF
  1. SVR后HCC预测Meta分析(27研究、近17万例),Clinical and Molecular Hepatology:https://www.e-cmh.org/journal/view.php?doi=10.3350/cmh.2024.0262
  1. Gut and Liver,SVR后监测指南分歧:https://www.gutnliver.org/journal/view.html?doi=10.5009/gnl250187
  1. Kresevic, Giuffrè et al., npj Digital Medicine (2024),RAG消融实验43%→99%:https://doi.org/10.1038/s41746-024-01091-y
  1. Giuffrè et al., Liver International (2025),RAG-Top10与SFT比较:https://arts.units.it/retrieve/ce70a753-66c6-4039-9197-89573d7350c1/Liver%20International%20-%202025%20-%20Giuffre%CC%80%20-%20From%20Guidelines%20to%20Real%E2%80%90Time%20Conversation%20%20Expert%E2%80%90Validated%20Retrieval%E2%80%90Augmented%20and%20%285%29.pdf
  1. Siepmann et al., Liver International (2025),GPT-4与WHO乙肝指南:https://pmc.ncbi.nlm.nih.gov/articles/PMC12402858/
  1. 176题病毒性肝炎LLM评测,Scientific Reports (2025):https://www.nature.com/articles/s41598-024-83575-1
  1. 四大LLM丙肝患者教育盲评研究:https://pmc.ncbi.nlm.nih.gov/articles/PMC12872381/
  1. 中国丙肝筛查治疗成本效益建模,Public Health:https://www.sciencedirect.com/science/article/pii/S0033350624000325
  1. 《柳叶刀·公共卫生》中国丙肝消除评论(2025):https://www.thelancet.com/journals/lanpub/article/PIIS2468-2667(25)00259-2/fulltext

媒体与行业报道(A/B级)

  1. Nursing in Practice,NHS英格兰AI筛查计划报道(2022年7月):https://www.nursinginpractice.com/latest-news/nhse-to-use-ai-to-identify-patients-at-risk-of-hepatitis-c/
  1. DistilINFO,OpenAI基金会B2F项目报道(2026年8月14日):https://distilinfo.com/2026/08/14/openai-foundation-follow-through/
  1. Fierce Healthcare,B2F项目技术细节:https://www.fiercehealthcare.com/ai-and-machine-learning/openai-foundation-common-health-coalition-launch-public-health-initiative

说明:文内数据以同行评议研究与官方机构发布为准;媒体报道仅用于项目动态类信息。