152 lines
6.7 KiB
Markdown
152 lines
6.7 KiB
Markdown
# 跨国家、跨年份与跨调查工具的语言条件化心理测量协调模型
|
||
|
||
## 一、项目定位
|
||
|
||
本项目拟开发一个可迁移的 **language-conditioned psychometric harmonization model**,用于协调不同国家、不同年份和不同调查工具中的青少年心理健康与自杀相关表型。
|
||
|
||
模型的核心问题不是比较 XGBoost、随机森林和深度学习的预测性能,也不是主要预测某个人是否会自杀,而是判断不同问卷措辞、语言、时间窗口、答案编码和文化背景是否测量了同一个心理构念,并将这些不完全等价的测量结果映射到统一、可比较的潜在表型空间。
|
||
|
||
## 二、研究目标
|
||
|
||
模型需要同时学习:
|
||
|
||
1. 问卷题目在语义上测量的心理构念;
|
||
2. 题目在真实人群中的心理测量属性;
|
||
3. 国家、年份、调查工具和人群背景对题目测量结果的影响;
|
||
4. 不同问卷之间可比较的个体潜在表型及其不确定性。
|
||
|
||
最终目标是让不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型进入同一个 measurement space,并能够迁移到训练时未见过的新题目、新问卷版本和新国家。
|
||
|
||
## 三、模型输入
|
||
|
||
### 1. 题目语义与测量信息
|
||
|
||
- question text;
|
||
- construct;
|
||
- time window;
|
||
- response options;
|
||
- response encoding;
|
||
- language;
|
||
- 可选的题目来源、题目版本和翻译信息。
|
||
|
||
### 2. 调查背景信息
|
||
|
||
- country;
|
||
- year;
|
||
- survey/instrument;
|
||
- questionnaire version;
|
||
- population;
|
||
- 其他与抽样、文化和调查实施有关的 context。
|
||
|
||
### 3. 受访者回答数据
|
||
|
||
- person × item response matrix;
|
||
- survey weight;
|
||
- PSU;
|
||
- stratum;
|
||
- 可选的年龄、性别等协变量,以及缺失模式和调查实施信息。
|
||
|
||
## 四、模型核心
|
||
|
||
模型采用 **semantic encoder + hierarchical psychometric model** 的架构。语义编码器从题目文本、时间窗口、答案选项和语言等信息中提取题目表示;分层心理测量模型结合 survey context 与 response patterns,学习题目在不同调查环境下的测量属性,并估计个体潜在表型。
|
||
|
||
核心不是简单地使用 LLM embedding 进行分类,而是学习一个从
|
||
|
||
> item semantics + survey context + response patterns
|
||
|
||
到 psychometric properties 的可迁移映射。
|
||
|
||
### 主要估计对象
|
||
|
||
- **Discrimination(a)**:题目区分不同潜在水平受访者的能力;
|
||
- **Threshold / difficulty(b)**:有序或分类回答对应的潜在水平阈值;
|
||
- **DIF(Differential Item Functioning)**:题目在不同国家、年份、语言、调查工具或人群中的测量差异;
|
||
- **Latent phenotype(θ)**:经过跨问卷校准后的个体潜在心理表型;
|
||
- **Uncertainty**:题目参数、DIF、个体得分和群体估计的不确定性。
|
||
|
||
可根据题目类型使用适当的 IRT、graded response、multidimensional 或其他层级心理测量形式;具体形式应服从题目的 construct、答案编码和数据结构,而不预先限定为单一模型。
|
||
|
||
## 五、模型输出
|
||
|
||
### 1. Item-level output
|
||
|
||
- 题目所属 construct;
|
||
- discrimination 参数 (a);
|
||
- threshold/difficulty 参数 (b);
|
||
- 国家、年份、语言、调查工具和人群层面的 DIF;
|
||
- 与已有题目的等值关系、语义相似度和可替代性;
|
||
- 参数估计及其 uncertainty。
|
||
|
||
### 2. Person-level output
|
||
|
||
- 经过跨问卷校准的 latent phenotype score (\theta);
|
||
- 个体得分的 uncertainty;
|
||
- 必要时输出多维 latent phenotype,而不是强制压缩为单一分数。
|
||
|
||
### 3. Population-level output
|
||
|
||
- 不同国家和年份的 harmonized phenotype distribution;
|
||
- 经过调查设计校正的 prevalence 或分位数估计;
|
||
- 跨调查、跨国家、跨年份的可比群体差异;
|
||
- 与 survey weight、PSU、stratum 相一致的标准误和不确定性区间。
|
||
|
||
## 六、最重要的迁移能力
|
||
|
||
模型的关键创新不是证明“LLM 让 AUC 提高了”,而是证明模型学习到了一个 **transferable psychometric measurement function**。
|
||
|
||
训练时应有意识地完全留出部分:
|
||
|
||
- item/question;
|
||
- questionnaire 或 instrument version;
|
||
- country;
|
||
- survey year;
|
||
- population subgroup。
|
||
|
||
在测试阶段,只向模型提供新题目的语义、调查 context 和少量 response data,评估其能否:
|
||
|
||
1. zero-shot 或 few-shot 恢复新题目的 psychometric parameters;
|
||
2. 识别新题目与已有题目的 construct 和等值关系;
|
||
3. 估计新国家、新问卷或新版本中的 DIF;
|
||
4. 将新调查回答映射回已有的统一 latent space;
|
||
5. 给出可靠的不确定性,而不是只输出一个过度确定的点估计。
|
||
|
||
因此,**unseen item / unseen survey / unseen country transfer** 应作为模型最重要的能力和主要验证目标。
|
||
|
||
## 七、验证框架
|
||
|
||
验证重点应从普通预测性能转向测量等价性、校准能力和迁移能力,包括:
|
||
|
||
- 留出题目后的 item parameter recovery;
|
||
- 留出问卷版本后的 harmonization;
|
||
- 留出国家或文化背景后的 transfer;
|
||
- 少量回答条件下的 few-shot calibration;
|
||
- 参数、个体分数和群体分布的不确定性校准;
|
||
- 与 anchor items、已建立量表或专家标注的一致性;
|
||
- 对问卷措辞、时间窗口和答案编码变化的敏感性分析;
|
||
- 使用 survey weight、PSU、stratum 后的群体估计有效性。
|
||
|
||
评价指标可包括参数恢复误差、DIF 检测准确性、latent score 一致性、群体分布距离、测量不变性指标、区间覆盖率和跨域校准误差。AUC、F1 等分类指标最多作为辅助分析,不应作为项目的主要成功标准。
|
||
|
||
## 八、构念可扩展性
|
||
|
||
架构应保持 construct-agnostic。自杀相关表型可以作为主要 benchmark,但模型不应被设计成只能处理 suicide risk。后续可扩展到:
|
||
|
||
- depression;
|
||
- psychological distress;
|
||
- anxiety;
|
||
- substance use;
|
||
- wellbeing;
|
||
- 其他可通过问卷题目测量的心理健康构念。
|
||
|
||
如果同一套语义条件化与心理测量协调机制能够跨 construct 泛化,将进一步支持该方法作为通用的跨文化、跨调查心理测量基础设施,而非单一任务的预测模型。
|
||
|
||
## 九、最简洁的项目概括
|
||
|
||
**Input:** item semantics + survey context + response data
|
||
|
||
**Model:** semantic encoder + hierarchical psychometric model
|
||
|
||
**Output:** item parameters + DIF + harmonized latent phenotype + uncertainty
|
||
|
||
**最终目的:** 将不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型映射到统一、可比较且可迁移的 measurement space,并对训练中未见过的新题目、新问卷和新国家完成 zero-shot 或 few-shot psychometric calibration 与 harmonization。
|