6.7 KiB
跨国家、跨年份与跨调查工具的语言条件化心理测量协调模型
一、项目定位
本项目拟开发一个可迁移的 language-conditioned psychometric harmonization model,用于协调不同国家、不同年份和不同调查工具中的青少年心理健康与自杀相关表型。
模型的核心问题不是比较 XGBoost、随机森林和深度学习的预测性能,也不是主要预测某个人是否会自杀,而是判断不同问卷措辞、语言、时间窗口、答案编码和文化背景是否测量了同一个心理构念,并将这些不完全等价的测量结果映射到统一、可比较的潜在表型空间。
二、研究目标
模型需要同时学习:
- 问卷题目在语义上测量的心理构念;
- 题目在真实人群中的心理测量属性;
- 国家、年份、调查工具和人群背景对题目测量结果的影响;
- 不同问卷之间可比较的个体潜在表型及其不确定性。
最终目标是让不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型进入同一个 measurement space,并能够迁移到训练时未见过的新题目、新问卷版本和新国家。
三、模型输入
1. 题目语义与测量信息
- question text;
- construct;
- time window;
- response options;
- response encoding;
- language;
- 可选的题目来源、题目版本和翻译信息。
2. 调查背景信息
- country;
- year;
- survey/instrument;
- questionnaire version;
- population;
- 其他与抽样、文化和调查实施有关的 context。
3. 受访者回答数据
- person × item response matrix;
- survey weight;
- PSU;
- stratum;
- 可选的年龄、性别等协变量,以及缺失模式和调查实施信息。
四、模型核心
模型采用 semantic encoder + hierarchical psychometric model 的架构。语义编码器从题目文本、时间窗口、答案选项和语言等信息中提取题目表示;分层心理测量模型结合 survey context 与 response patterns,学习题目在不同调查环境下的测量属性,并估计个体潜在表型。
核心不是简单地使用 LLM embedding 进行分类,而是学习一个从
item semantics + survey context + response patterns
到 psychometric properties 的可迁移映射。
主要估计对象
- Discrimination(a):题目区分不同潜在水平受访者的能力;
- Threshold / difficulty(b):有序或分类回答对应的潜在水平阈值;
- DIF(Differential Item Functioning):题目在不同国家、年份、语言、调查工具或人群中的测量差异;
- Latent phenotype(θ):经过跨问卷校准后的个体潜在心理表型;
- Uncertainty:题目参数、DIF、个体得分和群体估计的不确定性。
可根据题目类型使用适当的 IRT、graded response、multidimensional 或其他层级心理测量形式;具体形式应服从题目的 construct、答案编码和数据结构,而不预先限定为单一模型。
五、模型输出
1. Item-level output
- 题目所属 construct;
- discrimination 参数 (a);
- threshold/difficulty 参数 (b);
- 国家、年份、语言、调查工具和人群层面的 DIF;
- 与已有题目的等值关系、语义相似度和可替代性;
- 参数估计及其 uncertainty。
2. Person-level output
- 经过跨问卷校准的 latent phenotype score (\theta);
- 个体得分的 uncertainty;
- 必要时输出多维 latent phenotype,而不是强制压缩为单一分数。
3. Population-level output
- 不同国家和年份的 harmonized phenotype distribution;
- 经过调查设计校正的 prevalence 或分位数估计;
- 跨调查、跨国家、跨年份的可比群体差异;
- 与 survey weight、PSU、stratum 相一致的标准误和不确定性区间。
六、最重要的迁移能力
模型的关键创新不是证明“LLM 让 AUC 提高了”,而是证明模型学习到了一个 transferable psychometric measurement function。
训练时应有意识地完全留出部分:
- item/question;
- questionnaire 或 instrument version;
- country;
- survey year;
- population subgroup。
在测试阶段,只向模型提供新题目的语义、调查 context 和少量 response data,评估其能否:
- zero-shot 或 few-shot 恢复新题目的 psychometric parameters;
- 识别新题目与已有题目的 construct 和等值关系;
- 估计新国家、新问卷或新版本中的 DIF;
- 将新调查回答映射回已有的统一 latent space;
- 给出可靠的不确定性,而不是只输出一个过度确定的点估计。
因此,unseen item / unseen survey / unseen country transfer 应作为模型最重要的能力和主要验证目标。
七、验证框架
验证重点应从普通预测性能转向测量等价性、校准能力和迁移能力,包括:
- 留出题目后的 item parameter recovery;
- 留出问卷版本后的 harmonization;
- 留出国家或文化背景后的 transfer;
- 少量回答条件下的 few-shot calibration;
- 参数、个体分数和群体分布的不确定性校准;
- 与 anchor items、已建立量表或专家标注的一致性;
- 对问卷措辞、时间窗口和答案编码变化的敏感性分析;
- 使用 survey weight、PSU、stratum 后的群体估计有效性。
评价指标可包括参数恢复误差、DIF 检测准确性、latent score 一致性、群体分布距离、测量不变性指标、区间覆盖率和跨域校准误差。AUC、F1 等分类指标最多作为辅助分析,不应作为项目的主要成功标准。
八、构念可扩展性
架构应保持 construct-agnostic。自杀相关表型可以作为主要 benchmark,但模型不应被设计成只能处理 suicide risk。后续可扩展到:
- depression;
- psychological distress;
- anxiety;
- substance use;
- wellbeing;
- 其他可通过问卷题目测量的心理健康构念。
如果同一套语义条件化与心理测量协调机制能够跨 construct 泛化,将进一步支持该方法作为通用的跨文化、跨调查心理测量基础设施,而非单一任务的预测模型。
九、最简洁的项目概括
Input: item semantics + survey context + response data
Model: semantic encoder + hierarchical psychometric model
Output: item parameters + DIF + harmonized latent phenotype + uncertainty
最终目的: 将不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型映射到统一、可比较且可迁移的 measurement space,并对训练中未见过的新题目、新问卷和新国家完成 zero-shot 或 few-shot psychometric calibration 与 harmonization。