近日,上海交通大学医学院-国家热带病研究中心全球健康学院李国红教授团队在Nature合作期刊npjDigital Medicine发表题为Causal Reinforcement Learning for Personalized Adaptive Interventions in Mild Cognitive Impairment的研究论文。该研究提出了将因果推断与强化学习相结合的因果强化学习(CausalReinforcement Learning, CRL)框架,通过整合基于T-Learner的个体治疗效应(ITE)估计与保守Q学习(ConservativeQ-Learning, CQL)算法,在连续动作空间中优化轻度认知障碍(MCI)的个性化适应性干预策略,为认知健康的精准预防提供了新的方法学思路与初步实证依据。

随着全球人口老龄化进程加快,阿尔茨海默病及相关痴呆症的疾病负担持续增长。据估计,全球痴呆患者人数将从目前的5700万增至2050年的1.53亿,相关经济负担高达14.5万亿美元。越来越多的证据表明,在轻度认知障碍阶段实施早期干预有助于延缓疾病进展。体育锻炼与认知训练是目前较为公认的非药物干预手段,但现有方案在运动频率、时长和内容等方面差异较大,不同人群的干预效果也参差不齐。当前临床指南多依赖经验性的固定推荐方案,尚缺乏根据个体特征进行动态调整的系统化方法。
序贯多重随机分配试验(SMART)为制定适应性干预策略提供了有力的试验框架,但既有的分析方法,如加权回归和Q学习算法,仅能从已有的离散治疗序列中推导策略,难以在连续动作空间中实现最优方案搜索。与此同时,强化学习虽然为动态决策优化提供了潜在的分析框架,但在医疗健康场景的离线应用中面临若干挑战:标准强化学习方法容易对训练数据中未充分覆盖的动作产生过高的价值估计,可能导致策略推荐偏离安全范围;此外,奖励函数的设计往往难以充分反映个体间的治疗效应差异,而这恰恰是精准医学的核心关切。保守Q学习(CQL)通过对偏离行为策略的动作施加惩罚性正则化,在理论上约束了策略推荐不超出已有数据支撑的范围,在小样本离线数据条件下具有较好的稳健性,尤其适用于需优先考虑患者安全的医疗决策场景。基于上述考量,如何将因果推断中的个体治疗效应估计与保守强化学习的策略优化能力有机整合,在连续动作空间中实现MCI干预的个性化与精准化,成为本研究聚焦的核心科学问题。
围绕上述问题,研究团队基于一项在上海市三个随机抽取社区中开展的SMART试验数据,纳入61名社区轻度认知障碍患者(平均年龄71.0±6.0岁,67.2%为女性),涵盖三种干预模式:虚拟现实太极拳、线下太极拳和计算机化认知训练。研究构建了包含三个核心模块的因果强化学习框架。第一,采用T-Learner元学习方法,分别建模治疗组和对照组的潜在结局,估计每位参与者的个体治疗效应;第二,将个体治疗效应作为强化学习的奖励信号,以患者基线认知状态、共病情况和社会人口学特征定义状态空间;第三,通过保守Q学习算法在连续动作空间中搜索最优个性化干预组合,利用保守正则化约束确保策略推荐不偏离临床安全范围。

研究的核心发现揭示了因果强化学习框架在MCI精准干预中的初步价值。
干预效果的一致性提升。在四种机器学习算法(随机森林、梯度提升、XGBoost、LightGBM)的交叉验证中,CRL衍生策略相较于动态治疗方案(DTR),认知评分(MemoryGuard, MG)平均提升约1.03分(均P< 0.001)。这一改善幅度接近MoCA量表1至2分的最小临床意义差值参考标准,且在不同算法间保持高度一致,初步表明结果对特定建模假设的依赖性较低。
个性化决策的可解释性。SHAP分析揭示了算法决策的关键驱动因素:糖尿病状态是三种干预模式分配中影响最大的变量,其次为基线认知功能和年龄。决策树可视化显示,算法生成了三类干预强度方案,分别为高强度多模态方案(>90分钟/周,主要面向较年轻且认知受损者)、中等强度均衡方案(60至75分钟/周)和保守针对性方案(45至60分钟/周,主要面向高龄伴共病者),在一定程度上体现了算法在治疗效果与安全性、依从可行性之间的平衡。
异质性分析的探索性发现。探索性异质性分析提示,高血压可能是个体治疗获益的重要调节因素(治疗效应降低约1.5分),高龄、男性和较高受教育程度同样与较低的治疗获益存在统计学关联。值得关注的是,较高的基线认知功能与更大的治疗获益显著相关,且这一正向关联在男性和高龄参与者中更为突出,提示认知储备可能在干预反应中发挥一定作用。
干预负荷的潜在降低。CRL推荐的干预时长为每周15至90分钟,而SMART试验中的动态治疗方案为120至240分钟/周,提示干预负荷存在较大的降幅空间,个性化策略有望在维持干预效果的同时减轻患者负担,改善依从性,提高方案在社区场景中的可推广性。
本研究初步探索了因果推断与强化学习相结合在认知健康精准预防领域的应用前景。这一方法学框架有望为突破传统静态干预方案的局限提供新的思路,使基于个体特征的动态干预策略制定成为可能。该框架通过SHAP分析和决策树可视化提供的临床可解释性,有助于缩小算法推荐与临床实践之间的距离。同时,干预负荷的潜在降低如能得到验证,将有助于应对资源约束和依从性挑战,为社区MCI防控项目的可持续开展提供参考。
该研究是上海交通大学医学院推进数字医学与精准健康领域交叉创新的重要成果。本研究实现了从顶层设计、实地执行到逻辑求证的全链条原创,工作由团队内的博士及硕士研究生共同承担完成。论文共同第一作者为上海交通大学公共卫生学院博士后俞陈昊,附属瑞金医院临床营养科卞冬生和全球健康学院24级博士研究生张家韬,共同通讯作者为长三角健康研究院施贞夙教授和全球健康学院李国红教授。研究得到上海市公共卫生体系建设三年行动计划重点学科项目(GWVI-11.1-48)和云南省重点研发计划(202402AD080004)资助。研究在实施过程中得到了上海唯晶科技有限公司李斯维、浦东新区太极拳协会郭小普老师、普陀区曹杨社区卫生服务中心龚雯静主任医师、浦东新区塘桥社区卫生服务中心陆萍主任医师、上海特霍芬智能科技有限公司在受试者招募及管理、太极拳运动及认知训练的支持。