Files
language-conditioned-psycho…/Document/language-conditioned-psychometric-harmonization-model.md
T

152 lines
6.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 跨国家、跨年份与跨调查工具的语言条件化心理测量协调模型
## 一、项目定位
本项目拟开发一个可迁移的 **language-conditioned psychometric harmonization model**,用于协调不同国家、不同年份和不同调查工具中的青少年心理健康与自杀相关表型。
模型的核心问题不是比较 XGBoost、随机森林和深度学习的预测性能,也不是主要预测某个人是否会自杀,而是判断不同问卷措辞、语言、时间窗口、答案编码和文化背景是否测量了同一个心理构念,并将这些不完全等价的测量结果映射到统一、可比较的潜在表型空间。
## 二、研究目标
模型需要同时学习:
1. 问卷题目在语义上测量的心理构念;
2. 题目在真实人群中的心理测量属性;
3. 国家、年份、调查工具和人群背景对题目测量结果的影响;
4. 不同问卷之间可比较的个体潜在表型及其不确定性。
最终目标是让不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型进入同一个 measurement space,并能够迁移到训练时未见过的新题目、新问卷版本和新国家。
## 三、模型输入
### 1. 题目语义与测量信息
- question text
- construct
- time window
- response options
- response encoding
- language
- 可选的题目来源、题目版本和翻译信息。
### 2. 调查背景信息
- country
- year
- survey/instrument
- questionnaire version
- population
- 其他与抽样、文化和调查实施有关的 context。
### 3. 受访者回答数据
- person × item response matrix
- survey weight
- PSU
- stratum
- 可选的年龄、性别等协变量,以及缺失模式和调查实施信息。
## 四、模型核心
模型采用 **semantic encoder + hierarchical psychometric model** 的架构。语义编码器从题目文本、时间窗口、答案选项和语言等信息中提取题目表示;分层心理测量模型结合 survey context 与 response patterns,学习题目在不同调查环境下的测量属性,并估计个体潜在表型。
核心不是简单地使用 LLM embedding 进行分类,而是学习一个从
> item semantics + survey context + response patterns
到 psychometric properties 的可迁移映射。
### 主要估计对象
- **Discriminationa)**:题目区分不同潜在水平受访者的能力;
- **Threshold / difficultyb)**:有序或分类回答对应的潜在水平阈值;
- **DIFDifferential Item Functioning**:题目在不同国家、年份、语言、调查工具或人群中的测量差异;
- **Latent phenotype(θ)**:经过跨问卷校准后的个体潜在心理表型;
- **Uncertainty**:题目参数、DIF、个体得分和群体估计的不确定性。
可根据题目类型使用适当的 IRT、graded response、multidimensional 或其他层级心理测量形式;具体形式应服从题目的 construct、答案编码和数据结构,而不预先限定为单一模型。
## 五、模型输出
### 1. Item-level output
- 题目所属 construct
- discrimination 参数 (a)
- threshold/difficulty 参数 (b)
- 国家、年份、语言、调查工具和人群层面的 DIF;
- 与已有题目的等值关系、语义相似度和可替代性;
- 参数估计及其 uncertainty。
### 2. Person-level output
- 经过跨问卷校准的 latent phenotype score (\theta)
- 个体得分的 uncertainty
- 必要时输出多维 latent phenotype,而不是强制压缩为单一分数。
### 3. Population-level output
- 不同国家和年份的 harmonized phenotype distribution
- 经过调查设计校正的 prevalence 或分位数估计;
- 跨调查、跨国家、跨年份的可比群体差异;
- 与 survey weight、PSU、stratum 相一致的标准误和不确定性区间。
## 六、最重要的迁移能力
模型的关键创新不是证明“LLM 让 AUC 提高了”,而是证明模型学习到了一个 **transferable psychometric measurement function**
训练时应有意识地完全留出部分:
- item/question
- questionnaire 或 instrument version
- country
- survey year
- population subgroup。
在测试阶段,只向模型提供新题目的语义、调查 context 和少量 response data,评估其能否:
1. zero-shot 或 few-shot 恢复新题目的 psychometric parameters
2. 识别新题目与已有题目的 construct 和等值关系;
3. 估计新国家、新问卷或新版本中的 DIF;
4. 将新调查回答映射回已有的统一 latent space
5. 给出可靠的不确定性,而不是只输出一个过度确定的点估计。
因此,**unseen item / unseen survey / unseen country transfer** 应作为模型最重要的能力和主要验证目标。
## 七、验证框架
验证重点应从普通预测性能转向测量等价性、校准能力和迁移能力,包括:
- 留出题目后的 item parameter recovery
- 留出问卷版本后的 harmonization
- 留出国家或文化背景后的 transfer;
- 少量回答条件下的 few-shot calibration
- 参数、个体分数和群体分布的不确定性校准;
- 与 anchor items、已建立量表或专家标注的一致性;
- 对问卷措辞、时间窗口和答案编码变化的敏感性分析;
- 使用 survey weight、PSU、stratum 后的群体估计有效性。
评价指标可包括参数恢复误差、DIF 检测准确性、latent score 一致性、群体分布距离、测量不变性指标、区间覆盖率和跨域校准误差。AUC、F1 等分类指标最多作为辅助分析,不应作为项目的主要成功标准。
## 八、构念可扩展性
架构应保持 construct-agnostic。自杀相关表型可以作为主要 benchmark,但模型不应被设计成只能处理 suicide risk。后续可扩展到:
- depression
- psychological distress
- anxiety
- substance use
- wellbeing
- 其他可通过问卷题目测量的心理健康构念。
如果同一套语义条件化与心理测量协调机制能够跨 construct 泛化,将进一步支持该方法作为通用的跨文化、跨调查心理测量基础设施,而非单一任务的预测模型。
## 九、最简洁的项目概括
**Input** item semantics + survey context + response data
**Model** semantic encoder + hierarchical psychometric model
**Output** item parameters + DIF + harmonized latent phenotype + uncertainty
**最终目的:** 将不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型映射到统一、可比较且可迁移的 measurement space,并对训练中未见过的新题目、新问卷和新国家完成 zero-shot 或 few-shot psychometric calibration 与 harmonization。