Files

12 KiB
Raw Permalink Blame History

A language-conditioned psychometric foundation model for harmonizing adolescent suicide-risk phenotypes across countries and survey instruments 中文: 用于跨国家、 跨调查工具青少年自杀风险表型协调的语言条件化心理测量基础模 型

我们计划开发一个用于跨国家、 跨年份和跨调查工具协调青少年自杀相关表型的 语言条件化心理测量模型。 项目不是简单比较XGBoost、 随机森林和深度学习的 预测性能, 而是研究不同问卷措辞、 时间窗口、 答案编码和文化背景是否测量同 一心理构念,以及 LLM 题目语义能否帮助恢复这种可比性。 第一阶段请先完成模型可行性与可识别性审计。基于现有 GSHS、YRBS 和 NSDUH 数据, 建立受访者—题目回答矩阵、 题目共现矩阵和跨调查锚定题目表。 逐个国家—年份统计自杀意念、 计划、 尝试、 自伤及悲伤/绝望的有效题目数、 有 效样本数、 阳性事件数、 缺失机制和跳题条件。 判断哪些构念可以做IRT 或层级 潜变量模型, 哪些只能做直接二分类协调。 不得仅根据变量名判断题意, 必须使 用已经确认的官方问题、答案标签和编码。 请把欺凌、孤独、睡眠、物质使用、家庭支持、同伴支持和暴力暴露作为潜在表 型的解释变量, 不要在没有理论依据的情况下与自杀行为题目共同组成一个量表。 所有分析必须保留调查权重、PSU、stratum 和国家—年份标识。 第二阶段建立直接协调、 传统IRT、 层级IRT、Logistic、XGBoost 及可选 TabPFN 基线。 验证必须采用留一国家、 留一地区、 留一问卷版本和时间外验证, 不能只 做随机个体划分。 主要评价包括held-out likelihood、 校准、AUPRC、 加权患病率 误差、DIF 和不确定性覆盖。 第三阶段使用多语言 LLM 对官方题目正文、 时间窗口和答案标签分别生成嵌入, 检验其能否解释经验题目相关结构和传统 IRT 题目参数。必须设置人工构念标 签、传统文本特征、随机嵌入、打乱词序和删除时间窗口等对照。 第四阶段开发语言条件化层级心理测量模型,使 LLM 嵌入预测题目区分度、阈 值和跨国家 DIF,并实现对未见国家、未见问卷版本和新题目的不确定性推断。 完整模型必须与传统方法进行消融比较。

总体目标 开发一个将官方问卷文本、 答案编码、 调查背景和个体回答联合起来的模型, 使 不同国家、 年份和调查工具测得的自杀相关表型具有可比较性, 并量化这种协调

结果的不确定性。 主要科学问题 1. 不同问卷中的自杀意念、 计划、 尝试、 悲伤/绝望等题目, 是否测量相同的 潜在风险结构? 2. 题目措辞、时间窗口和回答方式的变化,会造成多大的测量偏差? 3. LLM 获得的题目语义表示,能否预测题目的难度、区分度、阈值及跨文 化偏移? 4. 加入题目语义后, 能否提升对未见国家、 未见年份和未见问卷版本的表型 协调能力? 5. 哪些题目在国家、 性别、 年龄、 调查年份之间存在差异项目功能, 即DIF? 6. 协调后的自杀风险表型,是否比简单的 0/1 变量更稳定、更可迁移? 二、需要先澄清的关键点 这个项目不能一开始就假设所有变量都能做 IRT。 经典 IRT 通常要求: • 同一受访者回答多个测量同一潜变量的条目; • 不同版本之间存在共同锚定条目; • 每个条目有足够的阳性回答; • 调查间存在可建立连接的重叠题目。 因此,第一项任务必须是“可识别性审计”。 如果多数受访者只有一条自杀意念题、 一个计划题和一个尝试题, 那么可以构建 “自杀行为严重程度/阶段”模型,但不能轻易声称建立了高精度临床潜变量量表。 此外, 不建议把欺凌、 孤独、 物质使用和家庭支持全部当作“自杀风险量表”的题 目。更合理的结构是: 测量层: 意念、计划、尝试、自伤、悲伤/绝望 ↓ 自杀相关潜在表型

解释层: 欺凌、孤独、睡眠、物质使用、家庭支持、 同伴支持、暴力暴露、国家社会环境 ↓ 解释潜在表型的差异及异质性 这样测量模型和病因/解释模型不会混淆。

三、具体研究目标 Aim 1:建立跨调查的标准化题目知识库 对 GSHS、YRBS 和 NSDUH 相关题目建立机器可读知识库。 每个题目至少包含: • 官方原文; • 如能获得,调查实施语言和译文; • 变量名; • 构念; • 时间窗口; • 行为对象; • 回答类型; • 原始答案标签; • 原始编码; • 缺失值类型; • 国家; • 年份; • 问卷版本; • 调查工具; • 适用人群和跳题条件; • weight、PSU、stratum

• 官方来源; • 人工确认状态。 交付物: • item_bank.csv • response_dictionary.csv • survey_design.csv • construct_ontology.yaml • 数据字典和质量报告 验收要求: • 进入正式模型的题目必须有官方文本; • 不得根据变量名猜测题意; • 每个协调变量必须能追溯到官方来源; • 主要结局变量人工双重核查; • 记录冲突和无法确认的变量,不强行填充。 Aim 2:建立语义表示和问卷本体 LLM 输入内容 不能只输入问题正文。建议将一个题目表示为: Construct: suicidal ideation Question: During the past 12 months, did you ever seriously consider attempting suicide? Time window: past 12 months Response options: Yes; No Population: school-attending adolescents Survey: GSHS Country: … Year: … Language: English 分别编码:

• 问题正文嵌入; • 时间窗口嵌入; • 回答标签嵌入; • 调查工具嵌入; • 国家语言背景嵌入; • 题目整体模板嵌入。 至少比较三类嵌入 1. 开源多语言模型; 2. 通用商业或高性能文本嵌入模型; 3. 精神健康领域或医学文本嵌入模型。 模型名称不应提前写死,以实际可复现性、许可证和数据合规性确定。 必须设置的对照 • 人工构念标签; • TF–IDF 或传统文本特征; • 不使用文本、只使用题目 ID; • 随机嵌入; • 打乱词序; • 删除时间窗口; • 删除回答标签; • 单语模型与多语言模型。 交付物: • item_embeddings.parquet • 题目相似度矩阵; • UMAP 或聚类图; • 语义聚类与人工构念的一致性结果; • 不同嵌入模型的稳定性报告。 Aim 3:开发语言条件化心理测量模型

建议先建立五级模型体系,不要直接开发最终复杂模型。 M0:直接协调基线 按官方定义将题目转化为: • 自杀意念:0/1; • 自杀计划:0/1; • 自杀尝试:0/1 或次数; • 悲伤/绝望:0/1; • 自伤:0/1 或频率。 这是所有高级模型必须超越的基线。 M1:传统心理测量模型 根据数据结构选择: • binary/graded-response IRT • two-parameter logistic IRT • continuation-ratio model • latent class analysis • bifactor model • item-factor model。 模型示意: [ P(Y_{ij}=1)=^{-1} {a_j(i-b_j)} ] 其中: • (Y{ij}):个体 (i) 对题目 (j) 的回答; • (i):个体自杀相关潜在表型; • (a_j):题目区分度; • (b_j):题目阈值或难度。 M2:层级跨国模型 允许题目参数随国家、年份和调查工具变化: [ b{jcy}=b_j+u_c+v_y+w_{survey}+_{jcy} ]

其中: • (u_c):国家效应; • (v_y):年份效应; • (w_{survey}):调查工具效应; • ({jcy}):题目在特定国家—年份的 DIF。 必须防止国家、 年份和调查工具完全共线。 无法分离时要降低模型复杂度或改变 参数化方式。 M3:语言条件化模型 让 LLM 语义嵌入预测题目参数: [ a_j= {f_a(e_j)} ][ b_j=f_b(e_j) ][ {jc}=f_{}(e_j,z_c) ] 其中: • (e_j):题目文本、时间窗口和答案标签的语义嵌入; • (z_c):国家语言及社会环境特征; • (f_a,f_b,f_{}):神经网络或贝叶斯函数。 这是项目的核心算法创新。 M4:不确定性与新调查适配 对未见过的新题目,只提供其文本和少量回答,即可估计: • 题目属于什么构念; • 可能的题目参数; • 与既有题目的等值关系; • 潜在表型分布; • 预测区间; • 是否超出模型适用范围。 可以使用: • Bayesian neural network • deep ensemble

• variational inference • conformal calibration • hierarchical shrinkage • few-shot/in-context adaptation。 “foundation model”的称谓需要谨慎: 只有当模型能跨构念、 跨数据集和跨任务迁 移时才适合使用。如果只处理几项自杀题,建议称为: Language-conditioned psychometric model 这在审稿中会更稳妥。

四、模型训练和验证设计 1. 不能随机划分全部个体 随机划分会让同一国家、 同一问卷版本同时出现在训练集和测试集, 容易产生虚 高结果。 必须包括: • 留一国家验证; • 留一 WHO 地区验证; • 留一调查版本验证; • 早期年份训练、晚期年份测试; • GSHS 训练、YRBS/NSDUH 外部验证; • 低收入国家与高收入国家交叉验证。 2. 三种核心验证任务 Task A:未见国家迁移 训练时完全排除某个国家,再评价模型能否恢复该国: • 题目参数; • 自杀表型分布; • 加权患病率; • 风险因素排序;

• 性别差异。 Task B:未见问卷版本迁移 训练集中不出现某种题目措辞或回答编码,仅用官方题目文本推断新条目参数。 这是最能体现 LLM 价值的任务。 Task C:跨调查工具迁移 • GSHS 训练; • YRBS 验证; • NSDUH 青少年样本验证。 必须先确定目标表型的定义确实可对应,不能直接比较未经协调的发生率。 3. 评价指标 测量质量 • posterior predictive checks • item characteristic curves • test information • empirical 与预测 itemitem correlation • factor congruence • measurement invariance • DIF 检出率及效应量; • latent score reliability。 泛化质量 • held-out item log-likelihood • held-out country log-likelihood • Brier score • AUROC 和 AUPRC • calibration slope/intercept • expected calibration error • prevalence estimation error

• country-level rank correlation • uncertainty coverage。 公平性 至少按以下亚组报告: • 性别; • 年龄; • 地区; • 国家收入组; • 调查语言; • 城乡——如果数据存在; • 边缘化群体——仅在变量可靠时使用。 需要区分: • 测量公平性:同样潜在风险是否产生相似回答概率; • 预测公平性:模型在不同群体上的性能是否一致; • 政策公平性:固定资源条件下谁被模型筛选出来。 4. 复杂抽样处理 同事必须保留: • survey weights • PSU • stratum; • 国家—年份调查标识。 建议同时进行: 1. survey-weighted 描述性统计; 2. pseudo-likelihood 或加权 Bayesian 模型; 3. PSU/stratum 稳健方差或重复权重近似; 4. 加权与不加权敏感性分析。 不能因为神经网络不方便使用复杂抽样设计,就把设计变量删除。

五、最重要的消融实验 这是算法稿能否成立的关键。 至少比较: 模型 文本语义 层级结构 DIF 调查设计 直接 0/1 协调 否 否 否 是 传统 IRT 否 否 部分 可选 层级 IRT 否 是 是 是 LLM 嵌入+普通分类器 是 否 否 否 语言条件化 IRT 是 是 是 是 完整模型 是 是 是 是+不确定性 额外消融: • 去除题目正文; • 去除时间窗口; • 去除答案标签; • 去除国家信息; • 去除年份; • 使用随机嵌入; • 替换不同 LLM; • 冻结与微调嵌入; • 删除低频题目; • 删除一个调查工具; • 不使用权重。 如果完整模型只提升随机划分 AUC,却不能提升未见国家或未见题目的结果, 创新性就不够。