163 lines
12 KiB
Markdown
163 lines
12 KiB
Markdown
A language-conditioned psychometric foundation model for harmonizing
|
||
adolescent suicide-risk phenotypes across countries and survey
|
||
instruments 中文: 用于跨国家、
|
||
跨调查工具青少年自杀风险表型协调的语言条件化心理测量基础模 型
|
||
|
||
我们计划开发一个用于跨国家、 跨年份和跨调查工具协调青少年自杀相关表型的
|
||
语言条件化心理测量模型。 项目不是简单比较XGBoost、 随机森林和深度学习的
|
||
预测性能, 而是研究不同问卷措辞、 时间窗口、
|
||
答案编码和文化背景是否测量同 一心理构念,以及 LLM
|
||
题目语义能否帮助恢复这种可比性。
|
||
第一阶段请先完成模型可行性与可识别性审计。基于现有 GSHS、YRBS 和 NSDUH
|
||
数据, 建立受访者—题目回答矩阵、 题目共现矩阵和跨调查锚定题目表。
|
||
逐个国家—年份统计自杀意念、 计划、 尝试、 自伤及悲伤/绝望的有效题目数、
|
||
有 效样本数、 阳性事件数、 缺失机制和跳题条件。 判断哪些构念可以做IRT
|
||
或层级 潜变量模型, 哪些只能做直接二分类协调。
|
||
不得仅根据变量名判断题意, 必须使 用已经确认的官方问题、答案标签和编码。
|
||
请把欺凌、孤独、睡眠、物质使用、家庭支持、同伴支持和暴力暴露作为潜在表
|
||
型的解释变量,
|
||
不要在没有理论依据的情况下与自杀行为题目共同组成一个量表。
|
||
所有分析必须保留调查权重、PSU、stratum 和国家—年份标识。
|
||
第二阶段建立直接协调、 传统IRT、 层级IRT、Logistic、XGBoost 及可选
|
||
TabPFN 基线。 验证必须采用留一国家、 留一地区、
|
||
留一问卷版本和时间外验证, 不能只 做随机个体划分。 主要评价包括held-out
|
||
likelihood、 校准、AUPRC、 加权患病率 误差、DIF 和不确定性覆盖。
|
||
第三阶段使用多语言 LLM 对官方题目正文、 时间窗口和答案标签分别生成嵌入,
|
||
检验其能否解释经验题目相关结构和传统 IRT 题目参数。必须设置人工构念标
|
||
签、传统文本特征、随机嵌入、打乱词序和删除时间窗口等对照。
|
||
第四阶段开发语言条件化层级心理测量模型,使 LLM 嵌入预测题目区分度、阈
|
||
值和跨国家 DIF,并实现对未见国家、未见问卷版本和新题目的不确定性推断。
|
||
完整模型必须与传统方法进行消融比较。
|
||
|
||
总体目标 开发一个将官方问卷文本、 答案编码、
|
||
调查背景和个体回答联合起来的模型, 使 不同国家、
|
||
年份和调查工具测得的自杀相关表型具有可比较性, 并量化这种协调
|
||
|
||
结果的不确定性。 主要科学问题 1. 不同问卷中的自杀意念、 计划、 尝试、
|
||
悲伤/绝望等题目, 是否测量相同的 潜在风险结构? 2.
|
||
题目措辞、时间窗口和回答方式的变化,会造成多大的测量偏差? 3. LLM
|
||
获得的题目语义表示,能否预测题目的难度、区分度、阈值及跨文 化偏移? 4.
|
||
加入题目语义后, 能否提升对未见国家、 未见年份和未见问卷版本的表型
|
||
协调能力? 5. 哪些题目在国家、 性别、 年龄、
|
||
调查年份之间存在差异项目功能, 即DIF? 6.
|
||
协调后的自杀风险表型,是否比简单的 0/1 变量更稳定、更可迁移?
|
||
二、需要先澄清的关键点 这个项目不能一开始就假设所有变量都能做 IRT。 经典
|
||
IRT 通常要求: • 同一受访者回答多个测量同一潜变量的条目; •
|
||
不同版本之间存在共同锚定条目; • 每个条目有足够的阳性回答; •
|
||
调查间存在可建立连接的重叠题目。 因此,第一项任务必须是“可识别性审计”。
|
||
如果多数受访者只有一条自杀意念题、 一个计划题和一个尝试题, 那么可以构建
|
||
“自杀行为严重程度/阶段”模型,但不能轻易声称建立了高精度临床潜变量量表。
|
||
此外, 不建议把欺凌、 孤独、
|
||
物质使用和家庭支持全部当作“自杀风险量表”的题 目。更合理的结构是:
|
||
测量层: 意念、计划、尝试、自伤、悲伤/绝望 ↓ 自杀相关潜在表型
|
||
|
||
解释层: 欺凌、孤独、睡眠、物质使用、家庭支持、
|
||
同伴支持、暴力暴露、国家社会环境 ↓ 解释潜在表型的差异及异质性
|
||
这样测量模型和病因/解释模型不会混淆。
|
||
|
||
三、具体研究目标 Aim 1:建立跨调查的标准化题目知识库 对 GSHS、YRBS 和
|
||
NSDUH 相关题目建立机器可读知识库。 每个题目至少包含: • 官方原文; •
|
||
如能获得,调查实施语言和译文; • 变量名; • 构念; • 时间窗口; •
|
||
行为对象; • 回答类型; • 原始答案标签; • 原始编码; • 缺失值类型; •
|
||
国家; • 年份; • 问卷版本; • 调查工具; • 适用人群和跳题条件; •
|
||
weight、PSU、stratum;
|
||
|
||
• 官方来源; • 人工确认状态。 交付物: • item_bank.csv •
|
||
response_dictionary.csv • survey_design.csv • construct_ontology.yaml •
|
||
数据字典和质量报告 验收要求: • 进入正式模型的题目必须有官方文本; •
|
||
不得根据变量名猜测题意; • 每个协调变量必须能追溯到官方来源; •
|
||
主要结局变量人工双重核查; • 记录冲突和无法确认的变量,不强行填充。 Aim
|
||
2:建立语义表示和问卷本体 LLM 输入内容
|
||
不能只输入问题正文。建议将一个题目表示为: Construct: suicidal ideation
|
||
Question: During the past 12 months, did you ever seriously consider
|
||
attempting suicide? Time window: past 12 months Response options: Yes;
|
||
No Population: school-attending adolescents Survey: GSHS Country: …
|
||
Year: … Language: English 分别编码:
|
||
|
||
• 问题正文嵌入; • 时间窗口嵌入; • 回答标签嵌入; • 调查工具嵌入; •
|
||
国家语言背景嵌入; • 题目整体模板嵌入。 至少比较三类嵌入 1.
|
||
开源多语言模型; 2. 通用商业或高性能文本嵌入模型; 3.
|
||
精神健康领域或医学文本嵌入模型。
|
||
模型名称不应提前写死,以实际可复现性、许可证和数据合规性确定。
|
||
必须设置的对照 • 人工构念标签; • TF–IDF 或传统文本特征; •
|
||
不使用文本、只使用题目 ID; • 随机嵌入; • 打乱词序; • 删除时间窗口; •
|
||
删除回答标签; • 单语模型与多语言模型。 交付物: •
|
||
item_embeddings.parquet • 题目相似度矩阵; • UMAP 或聚类图; •
|
||
语义聚类与人工构念的一致性结果; • 不同嵌入模型的稳定性报告。 Aim
|
||
3:开发语言条件化心理测量模型
|
||
|
||
建议先建立五级模型体系,不要直接开发最终复杂模型。 M0:直接协调基线
|
||
按官方定义将题目转化为: • 自杀意念:0/1; • 自杀计划:0/1; •
|
||
自杀尝试:0/1 或次数; • 悲伤/绝望:0/1; • 自伤:0/1 或频率。
|
||
这是所有高级模型必须超越的基线。 M1:传统心理测量模型 根据数据结构选择:
|
||
• binary/graded-response IRT; • two-parameter logistic IRT; •
|
||
continuation-ratio model; • latent class analysis; • bifactor model;
|
||
• item-factor model。 模型示意: \[ P(Y\_{ij}=1)=^{-1} {a_j(*i-b_j)} \]
|
||
其中: • (Y*{ij}):个体 (i) 对题目 (j) 的回答; •
|
||
(*i):个体自杀相关潜在表型; • (a_j):题目区分度; •
|
||
(b_j):题目阈值或难度。 M2:层级跨国模型
|
||
允许题目参数随国家、年份和调查工具变化: \[
|
||
b*{jcy}=b_j+u_c+v_y+w\_{survey}+\_{jcy} \]
|
||
|
||
其中: • (u_c):国家效应; • (v_y):年份效应; •
|
||
(w\_{survey}):调查工具效应; • (*{jcy}):题目在特定国家—年份的 DIF。
|
||
必须防止国家、 年份和调查工具完全共线。 无法分离时要降低模型复杂度或改变
|
||
参数化方式。 M3:语言条件化模型 让 LLM 语义嵌入预测题目参数: \[ a_j=
|
||
{f_a(e_j)} \]\[ b_j=f_b(e_j) \]\[* {jc}=f\_{}(e_j,z_c) \] 其中: •
|
||
(e_j):题目文本、时间窗口和答案标签的语义嵌入; •
|
||
(z_c):国家语言及社会环境特征; •
|
||
(f_a,f_b,f\_{}):神经网络或贝叶斯函数。 这是项目的核心算法创新。
|
||
M4:不确定性与新调查适配
|
||
对未见过的新题目,只提供其文本和少量回答,即可估计: •
|
||
题目属于什么构念; • 可能的题目参数; • 与既有题目的等值关系; •
|
||
潜在表型分布; • 预测区间; • 是否超出模型适用范围。 可以使用: •
|
||
Bayesian neural network; • deep ensemble;
|
||
|
||
• variational inference; • conformal calibration; • hierarchical
|
||
shrinkage; • few-shot/in-context adaptation。 “foundation
|
||
model”的称谓需要谨慎: 只有当模型能跨构念、 跨数据集和跨任务迁
|
||
移时才适合使用。如果只处理几项自杀题,建议称为: Language-conditioned
|
||
psychometric model 这在审稿中会更稳妥。
|
||
|
||
四、模型训练和验证设计 1. 不能随机划分全部个体 随机划分会让同一国家、
|
||
同一问卷版本同时出现在训练集和测试集, 容易产生虚 高结果。 必须包括: •
|
||
留一国家验证; • 留一 WHO 地区验证; • 留一调查版本验证; •
|
||
早期年份训练、晚期年份测试; • GSHS 训练、YRBS/NSDUH 外部验证; •
|
||
低收入国家与高收入国家交叉验证。 2. 三种核心验证任务 Task
|
||
A:未见国家迁移 训练时完全排除某个国家,再评价模型能否恢复该国: •
|
||
题目参数; • 自杀表型分布; • 加权患病率; • 风险因素排序;
|
||
|
||
• 性别差异。 Task B:未见问卷版本迁移
|
||
训练集中不出现某种题目措辞或回答编码,仅用官方题目文本推断新条目参数。
|
||
这是最能体现 LLM 价值的任务。 Task C:跨调查工具迁移 • GSHS 训练; •
|
||
YRBS 验证; • NSDUH 青少年样本验证。
|
||
必须先确定目标表型的定义确实可对应,不能直接比较未经协调的发生率。 3.
|
||
评价指标 测量质量 • posterior predictive checks; • item characteristic
|
||
curves; • test information; • empirical 与预测 item–item correlation;
|
||
• factor congruence; • measurement invariance; • DIF 检出率及效应量;
|
||
• latent score reliability。 泛化质量 • held-out item log-likelihood; •
|
||
held-out country log-likelihood; • Brier score; • AUROC 和 AUPRC; •
|
||
calibration slope/intercept; • expected calibration error; •
|
||
prevalence estimation error;
|
||
|
||
• country-level rank correlation; • uncertainty coverage。 公平性
|
||
至少按以下亚组报告: • 性别; • 年龄; • 地区; • 国家收入组; •
|
||
调查语言; • 城乡——如果数据存在; • 边缘化群体——仅在变量可靠时使用。
|
||
需要区分: • 测量公平性:同样潜在风险是否产生相似回答概率; •
|
||
预测公平性:模型在不同群体上的性能是否一致; •
|
||
政策公平性:固定资源条件下谁被模型筛选出来。 4. 复杂抽样处理
|
||
同事必须保留: • survey weights; • PSU; • stratum; •
|
||
国家—年份调查标识。 建议同时进行: 1. survey-weighted 描述性统计; 2.
|
||
pseudo-likelihood 或加权 Bayesian 模型; 3. PSU/stratum
|
||
稳健方差或重复权重近似; 4. 加权与不加权敏感性分析。
|
||
不能因为神经网络不方便使用复杂抽样设计,就把设计变量删除。
|
||
|
||
五、最重要的消融实验 这是算法稿能否成立的关键。 至少比较: 模型 文本语义
|
||
层级结构 DIF 调查设计 直接 0/1 协调 否 否 否 是 传统 IRT 否 否 部分 可选
|
||
层级 IRT 否 是 是 是 LLM 嵌入+普通分类器 是 否 否 否 语言条件化 IRT 是
|
||
是 是 是 完整模型 是 是 是 是+不确定性 额外消融: • 去除题目正文; •
|
||
去除时间窗口; • 去除答案标签; • 去除国家信息; • 去除年份; •
|
||
使用随机嵌入; • 替换不同 LLM; • 冻结与微调嵌入; • 删除低频题目; •
|
||
删除一个调查工具; • 不使用权重。 如果完整模型只提升随机划分
|
||
AUC,却不能提升未见国家或未见题目的结果, 创新性就不够。
|