Files
language-conditioned-psycho…/Document/language-conditioned-psychometric-harmonization-model.md

6.7 KiB
Raw Permalink Blame History

跨国家、跨年份与跨调查工具的语言条件化心理测量协调模型

一、项目定位

本项目拟开发一个可迁移的 language-conditioned psychometric harmonization model,用于协调不同国家、不同年份和不同调查工具中的青少年心理健康与自杀相关表型。

模型的核心问题不是比较 XGBoost、随机森林和深度学习的预测性能,也不是主要预测某个人是否会自杀,而是判断不同问卷措辞、语言、时间窗口、答案编码和文化背景是否测量了同一个心理构念,并将这些不完全等价的测量结果映射到统一、可比较的潜在表型空间。

二、研究目标

模型需要同时学习:

  1. 问卷题目在语义上测量的心理构念;
  2. 题目在真实人群中的心理测量属性;
  3. 国家、年份、调查工具和人群背景对题目测量结果的影响;
  4. 不同问卷之间可比较的个体潜在表型及其不确定性。

最终目标是让不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型进入同一个 measurement space,并能够迁移到训练时未见过的新题目、新问卷版本和新国家。

三、模型输入

1. 题目语义与测量信息

  • question text
  • construct
  • time window
  • response options
  • response encoding
  • language
  • 可选的题目来源、题目版本和翻译信息。

2. 调查背景信息

  • country
  • year
  • survey/instrument
  • questionnaire version
  • population
  • 其他与抽样、文化和调查实施有关的 context。

3. 受访者回答数据

  • person × item response matrix
  • survey weight
  • PSU
  • stratum
  • 可选的年龄、性别等协变量,以及缺失模式和调查实施信息。

四、模型核心

模型采用 semantic encoder + hierarchical psychometric model 的架构。语义编码器从题目文本、时间窗口、答案选项和语言等信息中提取题目表示;分层心理测量模型结合 survey context 与 response patterns,学习题目在不同调查环境下的测量属性,并估计个体潜在表型。

核心不是简单地使用 LLM embedding 进行分类,而是学习一个从

item semantics + survey context + response patterns

到 psychometric properties 的可迁移映射。

主要估计对象

  • Discriminationa:题目区分不同潜在水平受访者的能力;
  • Threshold / difficultyb:有序或分类回答对应的潜在水平阈值;
  • DIFDifferential Item Functioning:题目在不同国家、年份、语言、调查工具或人群中的测量差异;
  • Latent phenotype(θ):经过跨问卷校准后的个体潜在心理表型;
  • Uncertainty:题目参数、DIF、个体得分和群体估计的不确定性。

可根据题目类型使用适当的 IRT、graded response、multidimensional 或其他层级心理测量形式;具体形式应服从题目的 construct、答案编码和数据结构,而不预先限定为单一模型。

五、模型输出

1. Item-level output

  • 题目所属 construct
  • discrimination 参数 (a)
  • threshold/difficulty 参数 (b)
  • 国家、年份、语言、调查工具和人群层面的 DIF;
  • 与已有题目的等值关系、语义相似度和可替代性;
  • 参数估计及其 uncertainty。

2. Person-level output

  • 经过跨问卷校准的 latent phenotype score (\theta)
  • 个体得分的 uncertainty
  • 必要时输出多维 latent phenotype,而不是强制压缩为单一分数。

3. Population-level output

  • 不同国家和年份的 harmonized phenotype distribution
  • 经过调查设计校正的 prevalence 或分位数估计;
  • 跨调查、跨国家、跨年份的可比群体差异;
  • 与 survey weight、PSU、stratum 相一致的标准误和不确定性区间。

六、最重要的迁移能力

模型的关键创新不是证明“LLM 让 AUC 提高了”,而是证明模型学习到了一个 transferable psychometric measurement function

训练时应有意识地完全留出部分:

  • item/question
  • questionnaire 或 instrument version
  • country
  • survey year
  • population subgroup。

在测试阶段,只向模型提供新题目的语义、调查 context 和少量 response data,评估其能否:

  1. zero-shot 或 few-shot 恢复新题目的 psychometric parameters
  2. 识别新题目与已有题目的 construct 和等值关系;
  3. 估计新国家、新问卷或新版本中的 DIF;
  4. 将新调查回答映射回已有的统一 latent space
  5. 给出可靠的不确定性,而不是只输出一个过度确定的点估计。

因此,unseen item / unseen survey / unseen country transfer 应作为模型最重要的能力和主要验证目标。

七、验证框架

验证重点应从普通预测性能转向测量等价性、校准能力和迁移能力,包括:

  • 留出题目后的 item parameter recovery
  • 留出问卷版本后的 harmonization
  • 留出国家或文化背景后的 transfer;
  • 少量回答条件下的 few-shot calibration
  • 参数、个体分数和群体分布的不确定性校准;
  • 与 anchor items、已建立量表或专家标注的一致性;
  • 对问卷措辞、时间窗口和答案编码变化的敏感性分析;
  • 使用 survey weight、PSU、stratum 后的群体估计有效性。

评价指标可包括参数恢复误差、DIF 检测准确性、latent score 一致性、群体分布距离、测量不变性指标、区间覆盖率和跨域校准误差。AUC、F1 等分类指标最多作为辅助分析,不应作为项目的主要成功标准。

八、构念可扩展性

架构应保持 construct-agnostic。自杀相关表型可以作为主要 benchmark,但模型不应被设计成只能处理 suicide risk。后续可扩展到:

  • depression
  • psychological distress
  • anxiety
  • substance use
  • wellbeing
  • 其他可通过问卷题目测量的心理健康构念。

如果同一套语义条件化与心理测量协调机制能够跨 construct 泛化,将进一步支持该方法作为通用的跨文化、跨调查心理测量基础设施,而非单一任务的预测模型。

九、最简洁的项目概括

Input item semantics + survey context + response data

Model semantic encoder + hierarchical psychometric model

Output item parameters + DIF + harmonized latent phenotype + uncertainty

最终目的: 将不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型映射到统一、可比较且可迁移的 measurement space,并对训练中未见过的新题目、新问卷和新国家完成 zero-shot 或 few-shot psychometric calibration 与 harmonization。