# 跨国家、跨年份与跨调查工具的语言条件化心理测量协调模型 ## 一、项目定位 本项目拟开发一个可迁移的 **language-conditioned psychometric harmonization model**,用于协调不同国家、不同年份和不同调查工具中的青少年心理健康与自杀相关表型。 模型的核心问题不是比较 XGBoost、随机森林和深度学习的预测性能,也不是主要预测某个人是否会自杀,而是判断不同问卷措辞、语言、时间窗口、答案编码和文化背景是否测量了同一个心理构念,并将这些不完全等价的测量结果映射到统一、可比较的潜在表型空间。 ## 二、研究目标 模型需要同时学习: 1. 问卷题目在语义上测量的心理构念; 2. 题目在真实人群中的心理测量属性; 3. 国家、年份、调查工具和人群背景对题目测量结果的影响; 4. 不同问卷之间可比较的个体潜在表型及其不确定性。 最终目标是让不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型进入同一个 measurement space,并能够迁移到训练时未见过的新题目、新问卷版本和新国家。 ## 三、模型输入 ### 1. 题目语义与测量信息 - question text; - construct; - time window; - response options; - response encoding; - language; - 可选的题目来源、题目版本和翻译信息。 ### 2. 调查背景信息 - country; - year; - survey/instrument; - questionnaire version; - population; - 其他与抽样、文化和调查实施有关的 context。 ### 3. 受访者回答数据 - person × item response matrix; - survey weight; - PSU; - stratum; - 可选的年龄、性别等协变量,以及缺失模式和调查实施信息。 ## 四、模型核心 模型采用 **semantic encoder + hierarchical psychometric model** 的架构。语义编码器从题目文本、时间窗口、答案选项和语言等信息中提取题目表示;分层心理测量模型结合 survey context 与 response patterns,学习题目在不同调查环境下的测量属性,并估计个体潜在表型。 核心不是简单地使用 LLM embedding 进行分类,而是学习一个从 > item semantics + survey context + response patterns 到 psychometric properties 的可迁移映射。 ### 主要估计对象 - **Discrimination(a)**:题目区分不同潜在水平受访者的能力; - **Threshold / difficulty(b)**:有序或分类回答对应的潜在水平阈值; - **DIF(Differential Item Functioning)**:题目在不同国家、年份、语言、调查工具或人群中的测量差异; - **Latent phenotype(θ)**:经过跨问卷校准后的个体潜在心理表型; - **Uncertainty**:题目参数、DIF、个体得分和群体估计的不确定性。 可根据题目类型使用适当的 IRT、graded response、multidimensional 或其他层级心理测量形式;具体形式应服从题目的 construct、答案编码和数据结构,而不预先限定为单一模型。 ## 五、模型输出 ### 1. Item-level output - 题目所属 construct; - discrimination 参数 (a); - threshold/difficulty 参数 (b); - 国家、年份、语言、调查工具和人群层面的 DIF; - 与已有题目的等值关系、语义相似度和可替代性; - 参数估计及其 uncertainty。 ### 2. Person-level output - 经过跨问卷校准的 latent phenotype score (\theta); - 个体得分的 uncertainty; - 必要时输出多维 latent phenotype,而不是强制压缩为单一分数。 ### 3. Population-level output - 不同国家和年份的 harmonized phenotype distribution; - 经过调查设计校正的 prevalence 或分位数估计; - 跨调查、跨国家、跨年份的可比群体差异; - 与 survey weight、PSU、stratum 相一致的标准误和不确定性区间。 ## 六、最重要的迁移能力 模型的关键创新不是证明“LLM 让 AUC 提高了”,而是证明模型学习到了一个 **transferable psychometric measurement function**。 训练时应有意识地完全留出部分: - item/question; - questionnaire 或 instrument version; - country; - survey year; - population subgroup。 在测试阶段,只向模型提供新题目的语义、调查 context 和少量 response data,评估其能否: 1. zero-shot 或 few-shot 恢复新题目的 psychometric parameters; 2. 识别新题目与已有题目的 construct 和等值关系; 3. 估计新国家、新问卷或新版本中的 DIF; 4. 将新调查回答映射回已有的统一 latent space; 5. 给出可靠的不确定性,而不是只输出一个过度确定的点估计。 因此,**unseen item / unseen survey / unseen country transfer** 应作为模型最重要的能力和主要验证目标。 ## 七、验证框架 验证重点应从普通预测性能转向测量等价性、校准能力和迁移能力,包括: - 留出题目后的 item parameter recovery; - 留出问卷版本后的 harmonization; - 留出国家或文化背景后的 transfer; - 少量回答条件下的 few-shot calibration; - 参数、个体分数和群体分布的不确定性校准; - 与 anchor items、已建立量表或专家标注的一致性; - 对问卷措辞、时间窗口和答案编码变化的敏感性分析; - 使用 survey weight、PSU、stratum 后的群体估计有效性。 评价指标可包括参数恢复误差、DIF 检测准确性、latent score 一致性、群体分布距离、测量不变性指标、区间覆盖率和跨域校准误差。AUC、F1 等分类指标最多作为辅助分析,不应作为项目的主要成功标准。 ## 八、构念可扩展性 架构应保持 construct-agnostic。自杀相关表型可以作为主要 benchmark,但模型不应被设计成只能处理 suicide risk。后续可扩展到: - depression; - psychological distress; - anxiety; - substance use; - wellbeing; - 其他可通过问卷题目测量的心理健康构念。 如果同一套语义条件化与心理测量协调机制能够跨 construct 泛化,将进一步支持该方法作为通用的跨文化、跨调查心理测量基础设施,而非单一任务的预测模型。 ## 九、最简洁的项目概括 **Input:** item semantics + survey context + response data **Model:** semantic encoder + hierarchical psychometric model **Output:** item parameters + DIF + harmonized latent phenotype + uncertainty **最终目的:** 将不同国家、不同年份、不同调查工具和不同问法测得的心理健康/自杀相关表型映射到统一、可比较且可迁移的 measurement space,并对训练中未见过的新题目、新问卷和新国家完成 zero-shot 或 few-shot psychometric calibration 与 harmonization。