Files
language-conditioned-psycho…/research/protocol/project_charter.md
T

9.1 KiB
Raw Blame History

Language-Conditioned Psychometric Harmonization Model:项目章程

版本:0.1.0
冻结日期:2026-09-20
状态:passed_for_gate_0
适用范围:阶段 0–2;阶段 2 完成后依据可识别性证据修订

1. 项目目的与主要研究问题

本项目不是普通个体风险预测竞赛,也不预设所有自杀相关变量属于一个单维量表。项目首先确认数据结构支持 IRT、层级测量、阶段/多结局模型还是只能直接协调。

Primary RQ 在 GSHS、YRBS 与 NSDUH 青少年相关数据中,题目正文、时间窗口和回答标签的语义表示,能否相对于最佳适用的无文本层级测量基线和人工构念标签基线,提高未见题目家族、未见问卷版本及未见国家/工具上的测量预测与校准,同时不造成有实质意义的区间质量退化?

支撑问题:

  1. 现有调查的题目共现、锚定连接和题目家族多样性是否足以识别各构念?
  2. 措辞、时间窗口、回答格式、语言、国家、年份和工具是否产生有实质意义的 DIF 或测量非等价?
  3. 题目语义能否解释训练资料中的响应结构和题目参数,并跨题目家族泛化?
  4. 对未见国家、工具和题目,模型的不确定性是否校准;zero-shot 与 few-shot 的表现如何?
  5. 复杂抽样、缺失/跳题、锚题和总体定义的合理替代方案是否改变结论?

2. 可证伪假设

语言条件化测量模型在预先冻结的外层迁移任务中,相对于最佳适用的 M0/M1/M2 与人工标签基线,在指定共同主指标上达到预设最小有意义改善,且校准或覆盖不劣于预设界限。

改善阈值、非劣界限和主指标数值将在阶段 2 的信息量审计和阶段 3 的模拟/功效校准后冻结。若语义模型没有稳定增益,项目输出应是阴性 benchmark 或适用边界,不更换测试集或事后挑选指标。

3. 目标总体和时间地域范围

  • 对象:青少年调查参与者。
  • GSHS:跨国开发候选,主要是学校在读样本;常见核心年龄为 13–17 岁,但必须逐国家—年份组件核验。
  • YRBS:问卷和时间迁移候选;美国高中生样本不得外推到全部美国青少年。
  • NSDUH:外部候选;家庭抽样框与学校调查框不可静默视为同一总体。
  • 跨工具比较优先使用年龄与适用总体共同支持域。精确年龄带在阶段 1 建立总体适用表后冻结;不能统一的总体分层报告。
  • YRBS 原始年份候选为 1991–2023;当前处理入口只到 2019,2021/2023 在布局验证前隔离。
  • NSDUH 当前处理候选为 2021–2024,只纳入确认属于青少年模块且有官方问题/编码证据的变量。
  • 国家背景仅在测量层建立后加入,并按调查时点可得性匹配。

4. 构念与变量角色

测量层分开登记,不预设单维:

  1. suicidal ideation
  2. suicide plan
  3. suicide attempt(二元和次数形式分开)
  4. self-harm(是否共模需证据)
  5. sadness/hopelessness(是否共模需证据)

欺凌、孤独、睡眠、物质使用、家庭/同伴支持、暴力暴露及国家背景属于解释或分层变量,不因相关或预测作用自动变成自杀风险量表题目。横断面关联不表述为因果或个体纵向预测。

阶段 2 为每个构念选择:IRT/多维测量、阶段/潜类别/多结局、直接二分类/频数协调,或分调查报告。

5. 数据角色与唯一候选入口

数据源 候选角色 唯一候选入口 状态
GSHS 跨国开发及未见国家验证 Dataset/GSHS-全球学生健康调查数据/GSHS/01_data/GSHS.csv audit_required
YRBS 问卷版本及时间迁移 处理包 YRBS/full_by_year19912019);原始核验用 YRBS_National_1991_2023/raw conditional
NSDUH 外部工具/总体候选 可直接分析数据包_NSDUH_YRBS/NSDUH/nsduh_2021_2024_full.parquet conditional
World Bank/WHO context 后期国家—年份解释层 WHO-country_context/world_bank_country_year_1990_2025.csv 及来源长表 conditional
其他目录 外部候选、文档或 provenance archive 不进入核心分析,除非书面改版

入口是审计入口,不表示其中变量已经通过题义、总体、设计或许可审计。

6. 冻结的迁移任务

  1. Unseen item family:同一家族全部措辞、翻译、回答和监督信号留出。
  2. Unseen questionnaire version:整个版本及泄漏等价版本留出。
  3. Unseen country:该国全部年份和组件回答留出,未知国家效应从层级分布预测并传播不确定性。
  4. Unseen region:整个预定地区留出。
  5. Temporal extrapolation:早期训练、后期测试,背景按预测时点可得性处理。
  6. Cross-instrument:总体和结局定义审计通过后再跨工具评估。

随机个体划分只用于调试或辅助比较,不作为核心迁移主张证据。

7. 估计目标和指标层级

主要目标是题目阈值/难度、区分度、DIF、共同标度成立时的潜在表型/群体分布,以及新题目/新域的预测分布与不确定性。

共同主指标候选:未见题目家族 held-out log score;未见国家/工具共同目标上的校准或分布误差;模拟已知真值下参数恢复与覆盖;群体估计的设计加权误差与区间表现。AUPRC、AUROC、Brier 等为辅助预测指标,不能单独证明测量协调成功。

8. 识别和调查设计原则

  • 语义相似只产生候选连接,不证明锚题不变或共同标度成立。
  • 国家均值、阈值平移和无约束 DIF 可能混淆;正式模型必须声明标度、参考组、锚题和 DIF 约束。
  • 独立信息单位主要是题目家族/版本及国家/工具等外层单元;大量受访者不能补偿题目种类不足。
  • 保留权重、PSU、stratum、国家—年份及组件标识。
  • 权重进入似然不等同于设计一致区间;描述性设计方差、模型内权重和设计型重抽样分开验证。
  • 未施测、不适用、合法跳题、拒答、不知道、普通缺失和真实阴性分开。

9. 范围外事项

  • 临床诊断、个体自杀预测或资源分配工具。
  • 用国家自杀死亡率作个体结局。
  • 无总体限定地把学校样本外推到全部青少年。
  • 在跨构念/数据集/任务证据不足时称为 foundation model。
  • 在阶段 2/3 前冻结最终深度架构、最终嵌入模型或结果后阈值。
  • 把 AI 预审登记为两名人类审核者。
  • 分发未经确认允许的微观数据。

10. 伦理、许可和治理

  • 数据按去标识化二次数据处理,但使用仍受来源现行条款和机构要求约束。
  • 不重新识别参与者,不公开再分发许可未确认的微数据。
  • 主要结局进入确认性分析前需两名实际审核者复核;AI 检查只标 provisional。
  • 输出记录 AI 辅助、数据来源、版本、哈希、模型/包版本及 unknown 状态。
  • 原始数据只读;衍生产物写入 research/
  • 改变总体、构念、数据角色、测试任务或成功判据时,必须提高本章程版本并在 Progression.md 记录原因。

11. 阶段 0 待验证清单

  1. 各调查组件的年龄、在校状态、地域、语言和问卷版本。
  2. 主要结局官方正文、答案标签、时间窗口、跳题和派生规则。
  3. GSHS 权重、PSU、stratum 的调查级有效性。
  4. YRBS 2021/2023 官方布局、导入程序、记录数和本地文件一致性。
  5. NSDUH 青少年/成人/COVID/派生变量边界及正确权重/方差设计。
  6. 锚题图、题目共现、阳性事件、结构缺失及有效题目家族数。
  7. 各来源现行许可、引用要求及衍生数据分发范围。
  8. 最接近方法文献和真实贡献边界;不得预设首创。
  9. 缺失的 R、复杂抽样、PyMC/ArviZ 和心理测量环境的锁定方案。

12. Gate 与停止条件

Gate 0 要求本章程、数据清单、文献矩阵和环境审计齐备。Gate 1 要求正式题目均有来源、编码、总体与缺失规则且主要结局完成人工双重核查。Gate 2 要求每个构念得到可进入潜变量模型/有条件/仅直接协调/不纳入的证据判定。

官方文本或编码无法确认、图不连通/标度不可识别、题目家族不足、设计字段不完整或参数恢复失败时按工作流降级;不得通过增加模型复杂度、替换最终测试或扩大主张掩盖失败。

13. 输入绑定

输入 SHA-256
Document/research-workflow.md 394a191359298132fc2a56304dbc49b5934f47af22d2e0fff47d28a0d9edcaeb
Document/项目的正式定位.md 28a415ff5d42649df2a7c68079ae0abfd295cbffb5fead216934a895cca4cd13
Document/language-conditioned-psychometric-harmonization-model.md 39d2050735f4df28c6abe08f8d1de6094b7ac11d0b6f2ccf9fd66d4cc450a825
research/audit/data_manifest.csv 0427a19c3287a2691edbd9a4486917989fe369fcb0f729a01477ce27cd8f98f2
research/audit/data_source_registry.csv ac68b9928f8855c5373034a30adda316da1da2f1a1e890b0c23f836f12d55b67
research/audit/environment_audit.md c84a6b05718bbaf7762021aa45b2f983e7c9ef844d41592d2138439251e929eb