From Knowledge to Inference: Formalizing Specialized Public Health Reasoning on GlobalHealthAtlas
我的贡献 My Contributions
我是该论文的共同第一作者(Equal Contribution)。在四位共同一作中,第一、第二作者为我的导师,我作为学生共同第一作者,独立负责了项目中两块核心工作从设计到微调的全流程:
Public-Model · 领域专用大模型
负责 Public-Model 从整体架构设计、训练方案制定到微调整个落地流程,构建面向公共卫生推理的领域定制模型。
Public-Scorer · 六维评测器
负责 Public-Scorer(六维领域评测器 / Public Evaluator)的完整设计、训练与微调,提出准确性、推理、完整性、共识对齐、术语规范、洞察力六维评估框架。
打分器与全部实验
独立负责论文中打分器(evaluator / scorer)与全部实验的设计、运行与结果分析,涵盖主实验、鲁棒性评测、消融实验、跨域迁移与数据缩放实验等。
相关开源成果已发布:GitHub 代码 · HuggingFace 评测器 · HuggingFace 模型。
摘要 Abstract
核心贡献 Contributions
可泛化的 AI4S 数据构建范式
建立了一个基于权威来源、高保真的多语言公共卫生数据集,覆盖数十万条经过精标的问题—答案对,横跨多领域、多语言、多难度与多题型;并提炼出一套可复用、可扩展的「AI for Science」科学数据构建范式,以模型驱动的生成、受控采样与多阶段质量精炼,克服领域数据稀缺。
六维正交的公共卫生推理评测器
针对流行病学约束,提出领域专属的评测框架,将评测任务显式拆解为六个正交维度,并通过微调 qwen 系列模型得到专用评测器,支撑公共卫生与通用医疗场景下原则化、可靠的指令式评估。
面向公共卫生的专用大模型 Public-Model
基于所提数据集与评测器,构建了领域定制的 Public-Model。大量实证实验表明其在推理能力与可靠性上均取得持续、稳健的提升,为提升大模型在公共卫生领域的推理水平提供了有力证据。
数据集 GlobalHealthAtlas
GlobalHealthAtlas 是一个大规模公共卫生数据集,包含 280,210 条经人工精标的实例,每条均带有完整的思维链(Chain-of-Thought, CoT)推理。数据源自 WHO IRIS 机构知识库逾 35,500 份权威文献,横跨 15 个公共卫生领域、17 种语言,并覆盖多种任务形态与三个难度层级。
领域分布(部分)
传染病预防监测与应对(23.91%)、卫生政策·体系与全球治理、营养与食品安全、精神健康与社会福利、卫生应急与灾害响应、烟草与物质滥用防控、非传染性疾病、健康老龄与长期照护等 15 类。
语言分布
以英语为主(64.64%),并广泛覆盖法语、俄语、西班牙语、越南语、波兰语等 16 种语言,支持跨语言分析与低资源语言评测。
任务形态
Single Choice:单选配对题;complexCOT:复杂推理轨迹题。每条约配多维元数据(领域、语言、难度、标签)。
难度分级
A 级学术/专业、B 级通识知识、C 级科普(约 4.41%),系统性刻画模型在不同专业门槛下的表现。
方法 数据工程流水线
我们采用以证据为中心(Evidence-Centric)的数据工程流水线,在大规模合成的同时保证科学严谨性。
提示驱动的合成中枢(Prompt-Driven Synthesis Hub)
通过结构化的领域提示,从权威文献中识别实体、事件、数值、干预措施、风险因子与核心结论,自动合成高质量问答与推理轨迹。
质量门与模式约束(Quality Gate & Schema Enforcement)
由 LLM-as-Judge 质量门按四维度裁决:问题与选项质量(Q)、答案质量(A)、文本相关性(R)、整体一致性(C),并按题型加权。单选题型的最终质量分定义为:
此外,采用 5-gram / 10-gram 数据泄漏检测,对命中率 ≥ 0.5 的题目予以剔除,确保评测反映真实推理而非记忆。
六维领域评测器 Evaluator
为弥补通用指标无法刻画公共卫生推理核心特征的缺陷,我们微调专用评测模型,将输出评估显式拆解为六个正交维度,每个维度对应医学推理与决策中的一个基础风险因素。
答案与证据、事实及标准结论的一致性。
推理链是否逻辑严密、步骤可验证。
是否覆盖必要的群体层面与政策语境要素。
是否符合权威机构与专家共识。
专业术语使用是否准确、规范。
是否给出有深度、可行动的公共健康洞见。
专用模型 Public-Model
基于所提数据集与评测器,我们构建了领域定制的 Public-Model(基于 qwen3-8b)。在 GlobalHealthAtlas 留出测试集(27,511 条)上,其在整体得分与正确率上显著优于通用临床模型:
| 模型 | GlobalHealthAtlas 得分 | 正确率 | 领域 |
|---|---|---|---|
| Public-Model (ours) | 6.532 | 89.02% | 公共卫生 |
| AntAngelMed | 6.449 | 86.13% | 公卫+医学 |
| BAICHUAN-M3 | 5.970 | 78.34% | 医学 |
| Medical_Model (8B) | 5.250 | 61.14% | 医学 |
注:临床模型即便在医学测试表现良好,在公共卫生任务上仍显著下滑,凸显了面向公共卫生的专门数据集的必要性。
在鲁棒性评测中,领域对齐模型稳定性明显更强:Public-Model 在改写(S1)下保持 >86% 准确率、跨语言(S3)下 84%、噪声注入(S2)下约 77%;而通用模型如 Llama-3.1-8B-Instruct 在噪声下骤降至 50%。
结论 Conclusion
GlobalHealthAtlas 是一个面向群体层面公共卫生推理的大规模多语言数据集。我们提供了原则化的构建流水线、结构化的训练/测试切分,以及为证据驱动、安全敏感任务量身打造的领域对齐评测框架;并进一步开发了专用评测器与 Public-Model。
实验表明,尽管当前前沿模型在常规基准上表现优异,但在真实扰动与跨语言场景下仍存在显著的鲁棒推理缺口;而在高质量领域数据上微调,能显著提升性能。更重要的是,足够的模型容量有助于吸收领域知识,同时改善其在医学领域的推理能力。通过为领域对齐的数据集与评测方法学奠定严谨基础,我们为构建面向真实世界决策的可靠大模型贡献力量。
附录 Figures
以下为论文中的补充配图,便于读者直观查看数据集的分布特征与数据来源构成。