董梧铮
论文详情 · ICML 2026

From Knowledge to Inference: Formalizing Specialized Public Health Reasoning on GlobalHealthAtlas

Zhaokun Yan*, Shan Xu*, Wuzheng Dong (董梧铮)*, Zhaohan Liu*, Lijie Feng, Chengxiao Dai, Tianqi Chen, Binfan Liu, Yunpu Ma, Wenting Wei, Yingting Li, Yi Zhang, Tongning Wu
* 表示共同第一作者(Equal Contribution)。本论文共同一作中,第一、第二作者为导师,董梧铮为学生共同第一作者,主导 Public-Model 与 Public-Scorer 的设计、微调与全部实验。
Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea · PMLR 306 · 2026
通讯作者:Tongning Wu <wutongning@caict.ac.cn>
280,210
条带完整推理链的实例
15
个公共卫生领域
17
种语言
6
维领域评测框架

我的贡献 My Contributions

我是该论文的共同第一作者(Equal Contribution)。在四位共同一作中,第一、第二作者为我的导师,我作为学生共同第一作者,独立负责了项目中两块核心工作从设计到微调的全流程

A

Public-Model · 领域专用大模型

负责 Public-Model 从整体架构设计、训练方案制定到微调整个落地流程,构建面向公共卫生推理的领域定制模型。

B

Public-Scorer · 六维评测器

负责 Public-Scorer(六维领域评测器 / Public Evaluator)的完整设计、训练与微调,提出准确性、推理、完整性、共识对齐、术语规范、洞察力六维评估框架。

C

打分器与全部实验

独立负责论文中打分器(evaluator / scorer)与全部实验的设计、运行与结果分析,涵盖主实验、鲁棒性评测、消融实验、跨域迁移与数据缩放实验等。

相关开源成果已发布:GitHub 代码 · HuggingFace 评测器 · HuggingFace 模型

摘要 Abstract

Public health reasoning requires population level inference grounded in scientific evidence, expert consensus, and safety constraints. However, it remains underexplored as a structured machine learning problem with limited supervised signals and benchmarks. We introduce GlobalHealthAtlas, a large scale multilingual dataset of 280,210 instances spanning 15 public health domains and 17 languages. We further propose a large language model (LLM) assisted construction and quality control pipeline with retrieval, deduplication, evidence grounding checks, and label validation to improve consistency at scale. Finally, we present a domain aligned evaluator distilled from high confidence judgments of diverse LLMs to assess outputs along six dimensions: Accuracy, Reasoning, Completeness, Consensus Alignment, Terminology Norms, and Insightfulness. Together, these contributions enable reproducible training and evaluation of LLMs for safety critical public health reasoning beyond conventional QA benchmarks.
中文概述:公共卫生推理要求模型基于科学证据、专家共识与安全约束,进行群体层面的推断。然而,它作为一个结构化机器学习问题长期被忽视。本文提出 GlobalHealthAtlas——一个覆盖 15 个公共卫生领域、17 种语言、含 280,210 条实例的大规模多语言数据集;并设计了一套由大模型辅助、带检索、去重、证据溯源校验与标签验证的数据构建与质量控制流水线。此外,我们蒸馏出一个领域对齐的评测器,从准确性、推理、完整性、共识对齐、术语规范与洞察力六个维度评估模型输出。三者共同使面向安全关键场景的公共卫生推理具备了可复现的训练与评测能力。

核心贡献 Contributions

1

可泛化的 AI4S 数据构建范式

建立了一个基于权威来源、高保真的多语言公共卫生数据集,覆盖数十万条经过精标的问题—答案对,横跨多领域、多语言、多难度与多题型;并提炼出一套可复用、可扩展的「AI for Science」科学数据构建范式,以模型驱动的生成、受控采样与多阶段质量精炼,克服领域数据稀缺。

2

六维正交的公共卫生推理评测器

针对流行病学约束,提出领域专属的评测框架,将评测任务显式拆解为六个正交维度,并通过微调 qwen 系列模型得到专用评测器,支撑公共卫生与通用医疗场景下原则化、可靠的指令式评估。

3

面向公共卫生的专用大模型 Public-Model

基于所提数据集与评测器,构建了领域定制的 Public-Model。大量实证实验表明其在推理能力与可靠性上均取得持续、稳健的提升,为提升大模型在公共卫生领域的推理水平提供了有力证据。

数据集 GlobalHealthAtlas

GlobalHealthAtlas 是一个大规模公共卫生数据集,包含 280,210 条经人工精标的实例,每条均带有完整的思维链(Chain-of-Thought, CoT)推理。数据源自 WHO IRIS 机构知识库逾 35,500 份权威文献,横跨 15 个公共卫生领域、17 种语言,并覆盖多种任务形态与三个难度层级。

领域分布(部分)

传染病预防监测与应对(23.91%)、卫生政策·体系与全球治理、营养与食品安全、精神健康与社会福利、卫生应急与灾害响应、烟草与物质滥用防控、非传染性疾病、健康老龄与长期照护等 15 类。

语言分布

以英语为主(64.64%),并广泛覆盖法语、俄语、西班牙语、越南语、波兰语等 16 种语言,支持跨语言分析与低资源语言评测。

任务形态

Single Choice:单选配对题;complexCOT:复杂推理轨迹题。每条约配多维元数据(领域、语言、难度、标签)。

难度分级

A 级学术/专业、B 级通识知识、C 级科普(约 4.41%),系统性刻画模型在不同专业门槛下的表现。

方法 数据工程流水线

我们采用以证据为中心(Evidence-Centric)的数据工程流水线,在大规模合成的同时保证科学严谨性。

提示驱动的合成中枢(Prompt-Driven Synthesis Hub)

通过结构化的领域提示,从权威文献中识别实体、事件、数值、干预措施、风险因子与核心结论,自动合成高质量问答与推理轨迹。

质量门与模式约束(Quality Gate & Schema Enforcement)

由 LLM-as-Judge 质量门按四维度裁决:问题与选项质量(Q)、答案质量(A)、文本相关性(R)、整体一致性(C),并按题型加权。单选题型的最终质量分定义为:

SSC = 0.45·Q + 0.25·A + 0.20·R + 0.10·C

此外,采用 5-gram / 10-gram 数据泄漏检测,对命中率 ≥ 0.5 的题目予以剔除,确保评测反映真实推理而非记忆。

GlobalHealthAtlas 数据处理流水线
Figure 4. GlobalHealthAtlas 数据处理流水线:从原始公共卫生文献到高质量、带证据溯源与一致性校验的实例。

六维领域评测器 Evaluator

为弥补通用指标无法刻画公共卫生推理核心特征的缺陷,我们微调专用评测模型,将输出评估显式拆解为六个正交维度,每个维度对应医学推理与决策中的一个基础风险因素。

准确性Accuracy

答案与证据、事实及标准结论的一致性。

推理Reasoning

推理链是否逻辑严密、步骤可验证。

完整性Completeness

是否覆盖必要的群体层面与政策语境要素。

共识对齐Consensus Alignment

是否符合权威机构与专家共识。

术语规范Terminology Norms

专业术语使用是否准确、规范。

洞察力Insightfulness

是否给出有深度、可行动的公共健康洞见。

专用模型 Public-Model

基于所提数据集与评测器,我们构建了领域定制的 Public-Model(基于 qwen3-8b)。在 GlobalHealthAtlas 留出测试集(27,511 条)上,其在整体得分与正确率上显著优于通用临床模型:

模型GlobalHealthAtlas 得分正确率领域
Public-Model (ours)6.53289.02%公共卫生
AntAngelMed6.44986.13%公卫+医学
BAICHUAN-M35.97078.34%医学
Medical_Model (8B)5.25061.14%医学

注:临床模型即便在医学测试表现良好,在公共卫生任务上仍显著下滑,凸显了面向公共卫生的专门数据集的必要性。

在鲁棒性评测中,领域对齐模型稳定性明显更强:Public-Model 在改写(S1)下保持 >86% 准确率、跨语言(S3)下 84%、噪声注入(S2)下约 77%;而通用模型如 Llama-3.1-8B-Instruct 在噪声下骤降至 50%。

不同微调策略下跨难度水平的性能变化
Figure 2. 不同微调策略下,模型在 A/B/C 三个难度层级上的性能变化。

结论 Conclusion

GlobalHealthAtlas 是一个面向群体层面公共卫生推理的大规模多语言数据集。我们提供了原则化的构建流水线、结构化的训练/测试切分,以及为证据驱动、安全敏感任务量身打造的领域对齐评测框架;并进一步开发了专用评测器与 Public-Model。

实验表明,尽管当前前沿模型在常规基准上表现优异,但在真实扰动与跨语言场景下仍存在显著的鲁棒推理缺口;而在高质量领域数据上微调,能显著提升性能。更重要的是,足够的模型容量有助于吸收领域知识,同时改善其在医学领域的推理能力。通过为领域对齐的数据集与评测方法学奠定严谨基础,我们为构建面向真实世界决策的可靠大模型贡献力量。

附录 Figures

以下为论文中的补充配图,便于读者直观查看数据集的分布特征与数据来源构成。

GlobalHealthAtlas 语言与领域分布热力图
Figure 3. 样本在语言与领域维度上的分布热力图,体现跨语言、跨领域的系统性覆盖。
最终评测数据的数据来源分布
Figure 5. 最终评测数据的数据来源分布,覆盖 WHO IRIS 等权威机构文献。