139 lines
9.1 KiB
Markdown
139 lines
9.1 KiB
Markdown
# Language-Conditioned Psychometric Harmonization Model:项目章程
|
||
|
||
版本:0.1.0
|
||
冻结日期:2026-09-20
|
||
状态:`passed_for_gate_0`
|
||
适用范围:阶段 0–2;阶段 2 完成后依据可识别性证据修订
|
||
|
||
## 1. 项目目的与主要研究问题
|
||
|
||
本项目不是普通个体风险预测竞赛,也不预设所有自杀相关变量属于一个单维量表。项目首先确认数据结构支持 IRT、层级测量、阶段/多结局模型还是只能直接协调。
|
||
|
||
**Primary RQ:** 在 GSHS、YRBS 与 NSDUH 青少年相关数据中,题目正文、时间窗口和回答标签的语义表示,能否相对于最佳适用的无文本层级测量基线和人工构念标签基线,提高未见题目家族、未见问卷版本及未见国家/工具上的测量预测与校准,同时不造成有实质意义的区间质量退化?
|
||
|
||
支撑问题:
|
||
|
||
1. 现有调查的题目共现、锚定连接和题目家族多样性是否足以识别各构念?
|
||
2. 措辞、时间窗口、回答格式、语言、国家、年份和工具是否产生有实质意义的 DIF 或测量非等价?
|
||
3. 题目语义能否解释训练资料中的响应结构和题目参数,并跨题目家族泛化?
|
||
4. 对未见国家、工具和题目,模型的不确定性是否校准;zero-shot 与 few-shot 的表现如何?
|
||
5. 复杂抽样、缺失/跳题、锚题和总体定义的合理替代方案是否改变结论?
|
||
|
||
## 2. 可证伪假设
|
||
|
||
语言条件化测量模型在预先冻结的外层迁移任务中,相对于最佳适用的 M0/M1/M2 与人工标签基线,在指定共同主指标上达到预设最小有意义改善,且校准或覆盖不劣于预设界限。
|
||
|
||
改善阈值、非劣界限和主指标数值将在阶段 2 的信息量审计和阶段 3 的模拟/功效校准后冻结。若语义模型没有稳定增益,项目输出应是阴性 benchmark 或适用边界,不更换测试集或事后挑选指标。
|
||
|
||
## 3. 目标总体和时间地域范围
|
||
|
||
- 对象:青少年调查参与者。
|
||
- GSHS:跨国开发候选,主要是学校在读样本;常见核心年龄为 13–17 岁,但必须逐国家—年份组件核验。
|
||
- YRBS:问卷和时间迁移候选;美国高中生样本不得外推到全部美国青少年。
|
||
- NSDUH:外部候选;家庭抽样框与学校调查框不可静默视为同一总体。
|
||
- 跨工具比较优先使用年龄与适用总体共同支持域。精确年龄带在阶段 1 建立总体适用表后冻结;不能统一的总体分层报告。
|
||
- YRBS 原始年份候选为 1991–2023;当前处理入口只到 2019,2021/2023 在布局验证前隔离。
|
||
- NSDUH 当前处理候选为 2021–2024,只纳入确认属于青少年模块且有官方问题/编码证据的变量。
|
||
- 国家背景仅在测量层建立后加入,并按调查时点可得性匹配。
|
||
|
||
## 4. 构念与变量角色
|
||
|
||
测量层分开登记,不预设单维:
|
||
|
||
1. suicidal ideation
|
||
2. suicide plan
|
||
3. suicide attempt(二元和次数形式分开)
|
||
4. self-harm(是否共模需证据)
|
||
5. sadness/hopelessness(是否共模需证据)
|
||
|
||
欺凌、孤独、睡眠、物质使用、家庭/同伴支持、暴力暴露及国家背景属于解释或分层变量,不因相关或预测作用自动变成自杀风险量表题目。横断面关联不表述为因果或个体纵向预测。
|
||
|
||
阶段 2 为每个构念选择:IRT/多维测量、阶段/潜类别/多结局、直接二分类/频数协调,或分调查报告。
|
||
|
||
## 5. 数据角色与唯一候选入口
|
||
|
||
| 数据源 | 候选角色 | 唯一候选入口 | 状态 |
|
||
|---|---|---|---|
|
||
| GSHS | 跨国开发及未见国家验证 | `Dataset/GSHS-全球学生健康调查数据/GSHS/01_data/GSHS.csv` | `audit_required` |
|
||
| YRBS | 问卷版本及时间迁移 | 处理包 `YRBS/full_by_year`(1991–2019);原始核验用 `YRBS_National_1991_2023/raw` | `conditional` |
|
||
| NSDUH | 外部工具/总体候选 | `可直接分析数据包_NSDUH_YRBS/NSDUH/nsduh_2021_2024_full.parquet` | `conditional` |
|
||
| World Bank/WHO context | 后期国家—年份解释层 | `WHO-country_context/world_bank_country_year_1990_2025.csv` 及来源长表 | `conditional` |
|
||
| 其他目录 | 外部候选、文档或 provenance archive | 无 | 不进入核心分析,除非书面改版 |
|
||
|
||
入口是审计入口,不表示其中变量已经通过题义、总体、设计或许可审计。
|
||
|
||
## 6. 冻结的迁移任务
|
||
|
||
1. **Unseen item family**:同一家族全部措辞、翻译、回答和监督信号留出。
|
||
2. **Unseen questionnaire version**:整个版本及泄漏等价版本留出。
|
||
3. **Unseen country**:该国全部年份和组件回答留出,未知国家效应从层级分布预测并传播不确定性。
|
||
4. **Unseen region**:整个预定地区留出。
|
||
5. **Temporal extrapolation**:早期训练、后期测试,背景按预测时点可得性处理。
|
||
6. **Cross-instrument**:总体和结局定义审计通过后再跨工具评估。
|
||
|
||
随机个体划分只用于调试或辅助比较,不作为核心迁移主张证据。
|
||
|
||
## 7. 估计目标和指标层级
|
||
|
||
主要目标是题目阈值/难度、区分度、DIF、共同标度成立时的潜在表型/群体分布,以及新题目/新域的预测分布与不确定性。
|
||
|
||
共同主指标候选:未见题目家族 held-out log score;未见国家/工具共同目标上的校准或分布误差;模拟已知真值下参数恢复与覆盖;群体估计的设计加权误差与区间表现。AUPRC、AUROC、Brier 等为辅助预测指标,不能单独证明测量协调成功。
|
||
|
||
## 8. 识别和调查设计原则
|
||
|
||
- 语义相似只产生候选连接,不证明锚题不变或共同标度成立。
|
||
- 国家均值、阈值平移和无约束 DIF 可能混淆;正式模型必须声明标度、参考组、锚题和 DIF 约束。
|
||
- 独立信息单位主要是题目家族/版本及国家/工具等外层单元;大量受访者不能补偿题目种类不足。
|
||
- 保留权重、PSU、stratum、国家—年份及组件标识。
|
||
- 权重进入似然不等同于设计一致区间;描述性设计方差、模型内权重和设计型重抽样分开验证。
|
||
- 未施测、不适用、合法跳题、拒答、不知道、普通缺失和真实阴性分开。
|
||
|
||
## 9. 范围外事项
|
||
|
||
- 临床诊断、个体自杀预测或资源分配工具。
|
||
- 用国家自杀死亡率作个体结局。
|
||
- 无总体限定地把学校样本外推到全部青少年。
|
||
- 在跨构念/数据集/任务证据不足时称为 foundation model。
|
||
- 在阶段 2/3 前冻结最终深度架构、最终嵌入模型或结果后阈值。
|
||
- 把 AI 预审登记为两名人类审核者。
|
||
- 分发未经确认允许的微观数据。
|
||
|
||
## 10. 伦理、许可和治理
|
||
|
||
- 数据按去标识化二次数据处理,但使用仍受来源现行条款和机构要求约束。
|
||
- 不重新识别参与者,不公开再分发许可未确认的微数据。
|
||
- 主要结局进入确认性分析前需两名实际审核者复核;AI 检查只标 provisional。
|
||
- 输出记录 AI 辅助、数据来源、版本、哈希、模型/包版本及 unknown 状态。
|
||
- 原始数据只读;衍生产物写入 `research/`。
|
||
- 改变总体、构念、数据角色、测试任务或成功判据时,必须提高本章程版本并在 `Progression.md` 记录原因。
|
||
|
||
## 11. 阶段 0 待验证清单
|
||
|
||
1. 各调查组件的年龄、在校状态、地域、语言和问卷版本。
|
||
2. 主要结局官方正文、答案标签、时间窗口、跳题和派生规则。
|
||
3. GSHS 权重、PSU、stratum 的调查级有效性。
|
||
4. YRBS 2021/2023 官方布局、导入程序、记录数和本地文件一致性。
|
||
5. NSDUH 青少年/成人/COVID/派生变量边界及正确权重/方差设计。
|
||
6. 锚题图、题目共现、阳性事件、结构缺失及有效题目家族数。
|
||
7. 各来源现行许可、引用要求及衍生数据分发范围。
|
||
8. 最接近方法文献和真实贡献边界;不得预设首创。
|
||
9. 缺失的 R、复杂抽样、PyMC/ArviZ 和心理测量环境的锁定方案。
|
||
|
||
## 12. Gate 与停止条件
|
||
|
||
Gate 0 要求本章程、数据清单、文献矩阵和环境审计齐备。Gate 1 要求正式题目均有来源、编码、总体与缺失规则且主要结局完成人工双重核查。Gate 2 要求每个构念得到可进入潜变量模型/有条件/仅直接协调/不纳入的证据判定。
|
||
|
||
官方文本或编码无法确认、图不连通/标度不可识别、题目家族不足、设计字段不完整或参数恢复失败时按工作流降级;不得通过增加模型复杂度、替换最终测试或扩大主张掩盖失败。
|
||
|
||
## 13. 输入绑定
|
||
|
||
| 输入 | SHA-256 |
|
||
|---|---|
|
||
| `Document/research-workflow.md` | `394a191359298132fc2a56304dbc49b5934f47af22d2e0fff47d28a0d9edcaeb` |
|
||
| `Document/项目的正式定位.md` | `28a415ff5d42649df2a7c68079ae0abfd295cbffb5fead216934a895cca4cd13` |
|
||
| `Document/language-conditioned-psychometric-harmonization-model.md` | `39d2050735f4df28c6abe08f8d1de6094b7ac11d0b6f2ccf9fd66d4cc450a825` |
|
||
| `research/audit/data_manifest.csv` | `0427a19c3287a2691edbd9a4486917989fe369fcb0f729a01477ce27cd8f98f2` |
|
||
| `research/audit/data_source_registry.csv` | `ac68b9928f8855c5373034a30adda316da1da2f1a1e890b0c23f836f12d55b67` |
|
||
| `research/audit/environment_audit.md` | `c84a6b05718bbaf7762021aa45b2f983e7c9ef844d41592d2138439251e929eb` |
|
||
|