

全切片图像(whole-slide image,WSI)的诊断是一个交互式的多阶段过程。面对一张千兆像素的切片,病理医生通常先在低倍率下建立全局印象,再逐级放大到可疑区域进行高倍分析,并在整张切片上反复穿梭、迭代地搜集证据,最终形成诊断结论。过去二十年,数字病理与人工智能(AI)深度交织,催生了第一代计算机辅助诊断工具;近年来,自监督病理基础模型与大语言模型、视觉语言模型(VLM)的兴起,把视觉理解与语言层面的推理结合起来,开启了 AI 病理智能体这一新前沿。
然而,能够自主导航视野、调整放大倍率并给出可解释诊断的实用型智能体系统始终未能出现。其根本原因在于,病理专家那种基于经验的、隐性的阅片行为, 从未进入模型的训练数据 。与编程或数学智能体不同,临床诊断无法由简单的规则化奖励来引导;智能体必须学会病理医生如何检查切片、以及针对每项任务应关注哪些区域。而现有数据集——无论是从互联网爬取的图像—标题对,还是临床 WSI 与报告的配对——普遍缺失病理医生的阅片行为。另一方面,现代数字病理系统虽会常规记录平移、缩放等导航事件,形成一条连续的行为记录,但这类「数字尾气」(digital exhaust)高频、嘈杂且极其冗长,只有经过精确捕捉、整理并转换为结构化、模型可读的表示,才能成为训练人类对齐智能体的可规模化监督来源。
2026 年 7 月 24 日,宾夕法尼亚大学病理与实验医学系黄治(Zhi Huang)教授团队 领衔 ,联合斯坦福大学 、 加州大学旧金山分校 , 在 Nature Biomedical Engineering 发表题为 Pathology-CoT: learning visual chain-of-thought agents from expert whole-slide image diagnosis behaviour 的研究论文。 该研究提出 Pathology-CoT 框架,通过三项核心贡献,将专家的视觉思维链行为转化为可规模化的智能体监督信号,并据此训练出人类对齐的病理智能体 Pathology-o3,在多项任务上显著超越当前最先进的视觉语言模型。王晟( Sheng Wang ) 与 Ruiming Wu 为论文共同第一作者,黄治(Zhi Huang)为论文通讯作者。


图 1 . AI 阅片记录仪把连续、嘈杂的阅片日志,转化为离散的行为指令与标准化关注区域(ROI)
该研究开发了一款病理 AI 阅片记录仪(AI Session Recorder) ,可在标准 WSI 阅片软件中无感知地运行。受物理显微镜离散物镜的启发,它将混乱的事件流转化为紧凑的行为指令序列:每条指令被定义为低倍率的广域巡视(inspect)或高倍率的快速细看(peek),并配对一个标准化的 ROI 边界框;随后,记录仪利用这些专家标定的 ROI 提示视觉语言模型,由后者起草「为何查看该区域、可见哪些关键发现」的临床推理,再由两位病理医生核验与修改,汇聚为 Pathology-CoT 智能体训练数据集。
在结直肠癌(CRC)淋巴结 N 分期这一临床代表性任务上,团队使用标准阅片软件 nuclei.io,采集了斯坦福医学 8 位病理医生(4 位主治、2 位专科培训医师、2 位住院医师)的行为数据,覆盖 25 个病例、137 张切片,累计 10.6 小时阅片,最终形成 921 个会话、5222 轮对话。同步的眼动追踪实验证实,记录仪生成的 ROI 与病理医生的真实注视数据高度吻合,可作为视觉注意力的可靠代理。计时研究进一步表明,这一半自动的人在回路流程比打字标注快约 5–6 倍 、比口述快约 3–4 倍,且约 80% 的 AI 生成文本无需任何编辑,构成了一台低成本、可规模化的数据采集引擎。
为验证行为数据的价值, 该项目 设计了任务条件化智能体 Pathology-o3 。它首先通过一个在离散行为指令上训练的行为预测器,在新切片上提出诊断性 ROI;随后执行行为引导的推理——对每个区域自动裁切高分辨率视野,向提示中注入任务上下文(病例级目标与信息、ROI 级意图),再由视觉语言模型生成逐区推理,并综合为病例级总结。该设计将「学到的人类观看策略」与「强大的推理模型」结合,使智能体能够为任一 WSI 输出可解释、可核验的分步视觉思维链。
结果显示,在淋巴结转移基准上,Pathology-o3 取得 84.5% 精确率、100% 召回率与 75.4% 准确率 ,次优的 OpenAI o3 为 46.7% / 87.5% / 57.8%。不具备思维链能力的视觉语言模型表现明显更差,且呈现失衡的权衡(如 GPT-4.1 召回率 91.7% 而精确率仅 42.3%,Llama-4 精确率 75.0% 而召回率仅 6.2%)。按肿瘤负荷分层的分析显示,性能差距在「困难边缘病例」上最为悬殊:面对直径 0.2 毫米的孤立肿瘤细胞,常规视觉语言模型纷纷失效,而本文智能体依靠主动放大维持了稳健的敏感性。
跨 foundation model 模型的对照实验进一步剥离出行为数据本身的贡献。相比无行为引导的基线,由学到的观看策略引导使精确率提升 17.0% 、召回率提升 11.4% ;而由资深主治医师真实行为引导(可视为实践上限)的提升为 17.9% 与 10.4%——学到的行为已弥合了与真实行为之间的大部分差距。这意味着,无需持续、大规模的专家数据采集,只需在有限数据上训练一个紧凑高效的行为预测器,即可蒸馏出专家的观看策略,成为可为任意视觉语言模型提供人类对齐引导的可规模化资产。
作者随后检验了所学策略的稳健性与导航本身的重要性。置换 ROI 的呈现顺序(正序、逆序、随机)后,智能体性能变化极小,说明其能有效综合证据而不依赖固定序列;而随着可查看的 ROI 数量上限放宽(类比思维链长度),性能稳步提升,召回率增益尤为显著。最关键的检验是撤除行为预测器、让视觉语言模型自行选取 ROI,并对照一位具有 12 年经验的资深胃肠道主治病理医生的真实路径。结果显示,无引导的视觉语言模型 ROI 选择零散且低产,而 Pathology-o3 集中于与主治医师真实行为高度重叠的临床显著位点。
这一结果揭示了「 分析—导航鸿沟 」(analysis–navigation gap):视觉语言模型强大的分析能力源自海量静态、预先裁切的图像语料;而其导航失败,则源于缺少刻画「与复杂环境持续、视觉引导式交互」的数据。这印证了本文以数据为中心的核心主张——构建有效的病理智能体,必须先把专家导航中隐性的、程序性的知识,数字化为适合学习的结构化形式。
为检验泛化性,在斯坦福数据上训练的 Pathology-o3 与行为预测器被直接迁移到完全独立的外部结肠腺癌淋巴结转移数据集 LNCO2(来自瑞典,321 张 WSI,使用不同扫描仪与倍率)。即便存在明显的域偏移,该智能体仍取得 69.4% 准确率、62.9% 精确率与 97.6% 的近乎完美召回率 ,其精确率是次优模型 Gemini(23.5%)的两倍以上。 文章 认为,这表明在「如何看、看哪里」层面上的监督,能够产生比像素级监督更能抵抗图像外观域偏移的可迁移观看策略。
为进一步验证框架的通用性,团队将 Pathology-CoT 拓展至组织结构与诊断挑战均迥异的皮肤病理。该任务不仅要求检出肿瘤,还需将其分为基底细胞癌(BCC)、鳞状细胞癌(SCC)与黑色素细胞肿瘤。重新训练后的 Pathology-o3 在外部皮肤病理队列上二分类肿瘤检出的召回率达 100.0%;在最具挑战的黑色素细胞肿瘤亚型判别上,零样本的 Pathology-o3 取得 88.9% 召回率 ,超过了在全量数据上完全监督训练的最佳多示例学习(MIL)模型(CONCH-ABMIL,66.7%)。定性分析表明,性能增益源自智能体复现了专家级的主动视觉:它学会主动放大至真皮—表皮交界处、异型细胞巢等解剖学标志,从而分辨出 BCC 的周边栅栏状排列、SCC 的角化珠等在低倍率下不可见的细微形态特征。
此外,作者还评估了该智能体框架与传统多示例 (multiple instance learning, MIL) 学习(基于 UNI、PLIP、MUSK、CONCH 等病理基础模型)的关系。在低数据场景下,单样本 MIL 基线常常无法召回任何阳性实例,而零样本的 Pathology-o3 依然稳健;更进一步,把行为预测器作为一种「硬注意力」机制来筛选输入图块,可将数据处理量削减 60% 以上,而性能与遍历全切片的基线持平,在细粒度任务中甚至因剔除背景干扰而准确率更高。
总体而言,该研究直面数字病理智能体发展的核心瓶颈——如何获得既具临床意义又可规模化的数据。通过把常规阅片日志转化为任务条件化的行为监督,并与低成本、专家核验的推理配对,Pathology-CoT 为现有架构演化为强大的、人类对齐的智能体提供了所需的监督信号,是迈向行为奠基、临床可信的计算病理 AI 系统的关键一步。
本研究由宾夕法尼亚大学黄治(Zhi Huang)教授指导完成并担任通讯作者, 王晟( Sheng Wang ) 、Ruiming Wu 为共同第一作者,合作单位包括加州大学旧金山分校与斯坦福大学。
https://www.nature.com/articles/s41551-026-01739-y
代码与数据:https://github.com/zhihuanglab/Pathology-CoT
制版人: 十一
学术合作组织
(*排名不分先后)

战略合作伙伴
(*排名不分先后)
推荐直播
转载须知
【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘

点击主页推荐活动
关注更多最新活动!
倍顺网提示:文章来自网络,不代表本站观点。