Files

163 lines
12 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
A language-conditioned psychometric foundation model for harmonizing
adolescent suicide-risk phenotypes across countries and survey
instruments 中文: 用于跨国家、
跨调查工具青少年自杀风险表型协调的语言条件化心理测量基础模 型
我们计划开发一个用于跨国家、 跨年份和跨调查工具协调青少年自杀相关表型的
语言条件化心理测量模型。 项目不是简单比较XGBoost、 随机森林和深度学习的
预测性能, 而是研究不同问卷措辞、 时间窗口、
答案编码和文化背景是否测量同 一心理构念,以及 LLM
题目语义能否帮助恢复这种可比性。
第一阶段请先完成模型可行性与可识别性审计。基于现有 GSHS、YRBS 和 NSDUH
数据, 建立受访者—题目回答矩阵、 题目共现矩阵和跨调查锚定题目表。
逐个国家—年份统计自杀意念、 计划、 尝试、 自伤及悲伤/绝望的有效题目数、
有 效样本数、 阳性事件数、 缺失机制和跳题条件。 判断哪些构念可以做IRT
或层级 潜变量模型, 哪些只能做直接二分类协调。
不得仅根据变量名判断题意, 必须使 用已经确认的官方问题、答案标签和编码。
请把欺凌、孤独、睡眠、物质使用、家庭支持、同伴支持和暴力暴露作为潜在表
型的解释变量,
不要在没有理论依据的情况下与自杀行为题目共同组成一个量表。
所有分析必须保留调查权重、PSU、stratum 和国家—年份标识。
第二阶段建立直接协调、 传统IRT、 层级IRT、Logistic、XGBoost 及可选
TabPFN 基线。 验证必须采用留一国家、 留一地区、
留一问卷版本和时间外验证, 不能只 做随机个体划分。 主要评价包括held-out
likelihood、 校准、AUPRC、 加权患病率 误差、DIF 和不确定性覆盖。
第三阶段使用多语言 LLM 对官方题目正文、 时间窗口和答案标签分别生成嵌入,
检验其能否解释经验题目相关结构和传统 IRT 题目参数。必须设置人工构念标
签、传统文本特征、随机嵌入、打乱词序和删除时间窗口等对照。
第四阶段开发语言条件化层级心理测量模型,使 LLM 嵌入预测题目区分度、阈
值和跨国家 DIF,并实现对未见国家、未见问卷版本和新题目的不确定性推断。
完整模型必须与传统方法进行消融比较。
总体目标 开发一个将官方问卷文本、 答案编码、
调查背景和个体回答联合起来的模型, 使 不同国家、
年份和调查工具测得的自杀相关表型具有可比较性, 并量化这种协调
结果的不确定性。 主要科学问题 1. 不同问卷中的自杀意念、 计划、 尝试、
悲伤/绝望等题目, 是否测量相同的 潜在风险结构? 2.
题目措辞、时间窗口和回答方式的变化,会造成多大的测量偏差? 3. LLM
获得的题目语义表示,能否预测题目的难度、区分度、阈值及跨文 化偏移? 4.
加入题目语义后, 能否提升对未见国家、 未见年份和未见问卷版本的表型
协调能力? 5. 哪些题目在国家、 性别、 年龄、
调查年份之间存在差异项目功能, 即DIF? 6.
协调后的自杀风险表型,是否比简单的 0/1 变量更稳定、更可迁移?
二、需要先澄清的关键点 这个项目不能一开始就假设所有变量都能做 IRT。 经典
IRT 通常要求: • 同一受访者回答多个测量同一潜变量的条目; •
不同版本之间存在共同锚定条目; • 每个条目有足够的阳性回答; •
调查间存在可建立连接的重叠题目。 因此,第一项任务必须是“可识别性审计”。
如果多数受访者只有一条自杀意念题、 一个计划题和一个尝试题, 那么可以构建
“自杀行为严重程度/阶段”模型,但不能轻易声称建立了高精度临床潜变量量表。
此外, 不建议把欺凌、 孤独、
物质使用和家庭支持全部当作“自杀风险量表”的题 目。更合理的结构是:
测量层: 意念、计划、尝试、自伤、悲伤/绝望 ↓ 自杀相关潜在表型
解释层: 欺凌、孤独、睡眠、物质使用、家庭支持、
同伴支持、暴力暴露、国家社会环境 ↓ 解释潜在表型的差异及异质性
这样测量模型和病因/解释模型不会混淆。
三、具体研究目标 Aim 1:建立跨调查的标准化题目知识库 对 GSHS、YRBS 和
NSDUH 相关题目建立机器可读知识库。 每个题目至少包含: • 官方原文; •
如能获得,调查实施语言和译文; • 变量名; • 构念; • 时间窗口; •
行为对象; • 回答类型; • 原始答案标签; • 原始编码; • 缺失值类型; •
国家; • 年份; • 问卷版本; • 调查工具; • 适用人群和跳题条件; •
weight、PSU、stratum
• 官方来源; • 人工确认状态。 交付物: • item_bank.csv •
response_dictionary.csv • survey_design.csv • construct_ontology.yaml •
数据字典和质量报告 验收要求: • 进入正式模型的题目必须有官方文本; •
不得根据变量名猜测题意; • 每个协调变量必须能追溯到官方来源; •
主要结局变量人工双重核查; • 记录冲突和无法确认的变量,不强行填充。 Aim
2:建立语义表示和问卷本体 LLM 输入内容
不能只输入问题正文。建议将一个题目表示为: Construct: suicidal ideation
Question: During the past 12 months, did you ever seriously consider
attempting suicide? Time window: past 12 months Response options: Yes;
No Population: school-attending adolescents Survey: GSHS Country: …
Year: … Language: English 分别编码:
• 问题正文嵌入; • 时间窗口嵌入; • 回答标签嵌入; • 调查工具嵌入; •
国家语言背景嵌入; • 题目整体模板嵌入。 至少比较三类嵌入 1.
开源多语言模型; 2. 通用商业或高性能文本嵌入模型; 3.
精神健康领域或医学文本嵌入模型。
模型名称不应提前写死,以实际可复现性、许可证和数据合规性确定。
必须设置的对照 • 人工构念标签; • TF–IDF 或传统文本特征; •
不使用文本、只使用题目 ID; • 随机嵌入; • 打乱词序; • 删除时间窗口; •
删除回答标签; • 单语模型与多语言模型。 交付物: •
item_embeddings.parquet • 题目相似度矩阵; • UMAP 或聚类图; •
语义聚类与人工构念的一致性结果; • 不同嵌入模型的稳定性报告。 Aim
3:开发语言条件化心理测量模型
建议先建立五级模型体系,不要直接开发最终复杂模型。 M0:直接协调基线
按官方定义将题目转化为: • 自杀意念:0/1; • 自杀计划:0/1; •
自杀尝试:0/1 或次数; • 悲伤/绝望:0/1; • 自伤:0/1 或频率。
这是所有高级模型必须超越的基线。 M1:传统心理测量模型 根据数据结构选择:
• binary/graded-response IRT • two-parameter logistic IRT
continuation-ratio model • latent class analysis • bifactor model
• item-factor model。 模型示意: \[ P(Y\_{ij}=1)=^{-1} {a_j(*i-b_j)} \]
其中: • (Y*{ij}):个体 (i) 对题目 (j) 的回答; •
(*i):个体自杀相关潜在表型; • (a_j):题目区分度; •
(b_j):题目阈值或难度。 M2:层级跨国模型
允许题目参数随国家、年份和调查工具变化: \[
b*{jcy}=b_j+u_c+v_y+w\_{survey}+\_{jcy} \]
其中: • (u_c):国家效应; • (v_y):年份效应; •
(w\_{survey}):调查工具效应; • (*{jcy}):题目在特定国家—年份的 DIF。
必须防止国家、 年份和调查工具完全共线。 无法分离时要降低模型复杂度或改变
参数化方式。 M3:语言条件化模型 让 LLM 语义嵌入预测题目参数: \[ a_j=
{f_a(e_j)} \]\[ b_j=f_b(e_j) \]\[* {jc}=f\_{}(e_j,z_c) \] 其中: •
(e_j):题目文本、时间窗口和答案标签的语义嵌入; •
(z_c):国家语言及社会环境特征; •
(f_a,f_b,f\_{}):神经网络或贝叶斯函数。 这是项目的核心算法创新。
M4:不确定性与新调查适配
对未见过的新题目,只提供其文本和少量回答,即可估计: •
题目属于什么构念; • 可能的题目参数; • 与既有题目的等值关系; •
潜在表型分布; • 预测区间; • 是否超出模型适用范围。 可以使用: •
Bayesian neural network • deep ensemble
• variational inference • conformal calibration • hierarchical
shrinkage • few-shot/in-context adaptation。 “foundation
model”的称谓需要谨慎: 只有当模型能跨构念、 跨数据集和跨任务迁
移时才适合使用。如果只处理几项自杀题,建议称为: Language-conditioned
psychometric model 这在审稿中会更稳妥。
四、模型训练和验证设计 1. 不能随机划分全部个体 随机划分会让同一国家、
同一问卷版本同时出现在训练集和测试集, 容易产生虚 高结果。 必须包括: •
留一国家验证; • 留一 WHO 地区验证; • 留一调查版本验证; •
早期年份训练、晚期年份测试; • GSHS 训练、YRBS/NSDUH 外部验证; •
低收入国家与高收入国家交叉验证。 2. 三种核心验证任务 Task
A:未见国家迁移 训练时完全排除某个国家,再评价模型能否恢复该国: •
题目参数; • 自杀表型分布; • 加权患病率; • 风险因素排序;
• 性别差异。 Task B:未见问卷版本迁移
训练集中不出现某种题目措辞或回答编码,仅用官方题目文本推断新条目参数。
这是最能体现 LLM 价值的任务。 Task C:跨调查工具迁移 • GSHS 训练; •
YRBS 验证; • NSDUH 青少年样本验证。
必须先确定目标表型的定义确实可对应,不能直接比较未经协调的发生率。 3.
评价指标 测量质量 • posterior predictive checks • item characteristic
curves • test information • empirical 与预测 itemitem correlation
• factor congruence • measurement invariance • DIF 检出率及效应量;
• latent score reliability。 泛化质量 • held-out item log-likelihood
held-out country log-likelihood • Brier score • AUROC 和 AUPRC
calibration slope/intercept • expected calibration error
prevalence estimation error
• country-level rank correlation • uncertainty coverage。 公平性
至少按以下亚组报告: • 性别; • 年龄; • 地区; • 国家收入组; •
调查语言; • 城乡——如果数据存在; • 边缘化群体——仅在变量可靠时使用。
需要区分: • 测量公平性:同样潜在风险是否产生相似回答概率; •
预测公平性:模型在不同群体上的性能是否一致; •
政策公平性:固定资源条件下谁被模型筛选出来。 4. 复杂抽样处理
同事必须保留: • survey weights • PSU • stratum
国家—年份调查标识。 建议同时进行: 1. survey-weighted 描述性统计; 2.
pseudo-likelihood 或加权 Bayesian 模型; 3. PSU/stratum
稳健方差或重复权重近似; 4. 加权与不加权敏感性分析。
不能因为神经网络不方便使用复杂抽样设计,就把设计变量删除。
五、最重要的消融实验 这是算法稿能否成立的关键。 至少比较: 模型 文本语义
层级结构 DIF 调查设计 直接 0/1 协调 否 否 否 是 传统 IRT 否 否 部分 可选
层级 IRT 否 是 是 是 LLM 嵌入+普通分类器 是 否 否 否 语言条件化 IRT 是
是 是 是 完整模型 是 是 是 是+不确定性 额外消融: • 去除题目正文; •
去除时间窗口; • 去除答案标签; • 去除国家信息; • 去除年份; •
使用随机嵌入; • 替换不同 LLM; • 冻结与微调嵌入; • 删除低频题目; •
删除一个调查工具; • 不使用权重。 如果完整模型只提升随机划分
AUC,却不能提升未见国家或未见题目的结果, 创新性就不够。