Files
language-conditioned-psycho…/research/protocol/project_charter.md
T

139 lines
9.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Language-Conditioned Psychometric Harmonization Model:项目章程
版本:0.1.0
冻结日期:2026-09-20
状态:`passed_for_gate_0`
适用范围:阶段 0–2;阶段 2 完成后依据可识别性证据修订
## 1. 项目目的与主要研究问题
本项目不是普通个体风险预测竞赛,也不预设所有自杀相关变量属于一个单维量表。项目首先确认数据结构支持 IRT、层级测量、阶段/多结局模型还是只能直接协调。
**Primary RQ** 在 GSHS、YRBS 与 NSDUH 青少年相关数据中,题目正文、时间窗口和回答标签的语义表示,能否相对于最佳适用的无文本层级测量基线和人工构念标签基线,提高未见题目家族、未见问卷版本及未见国家/工具上的测量预测与校准,同时不造成有实质意义的区间质量退化?
支撑问题:
1. 现有调查的题目共现、锚定连接和题目家族多样性是否足以识别各构念?
2. 措辞、时间窗口、回答格式、语言、国家、年份和工具是否产生有实质意义的 DIF 或测量非等价?
3. 题目语义能否解释训练资料中的响应结构和题目参数,并跨题目家族泛化?
4. 对未见国家、工具和题目,模型的不确定性是否校准;zero-shot 与 few-shot 的表现如何?
5. 复杂抽样、缺失/跳题、锚题和总体定义的合理替代方案是否改变结论?
## 2. 可证伪假设
语言条件化测量模型在预先冻结的外层迁移任务中,相对于最佳适用的 M0/M1/M2 与人工标签基线,在指定共同主指标上达到预设最小有意义改善,且校准或覆盖不劣于预设界限。
改善阈值、非劣界限和主指标数值将在阶段 2 的信息量审计和阶段 3 的模拟/功效校准后冻结。若语义模型没有稳定增益,项目输出应是阴性 benchmark 或适用边界,不更换测试集或事后挑选指标。
## 3. 目标总体和时间地域范围
- 对象:青少年调查参与者。
- GSHS:跨国开发候选,主要是学校在读样本;常见核心年龄为 13–17 岁,但必须逐国家—年份组件核验。
- YRBS:问卷和时间迁移候选;美国高中生样本不得外推到全部美国青少年。
- NSDUH:外部候选;家庭抽样框与学校调查框不可静默视为同一总体。
- 跨工具比较优先使用年龄与适用总体共同支持域。精确年龄带在阶段 1 建立总体适用表后冻结;不能统一的总体分层报告。
- YRBS 原始年份候选为 1991–2023;当前处理入口只到 2019,2021/2023 在布局验证前隔离。
- NSDUH 当前处理候选为 2021–2024,只纳入确认属于青少年模块且有官方问题/编码证据的变量。
- 国家背景仅在测量层建立后加入,并按调查时点可得性匹配。
## 4. 构念与变量角色
测量层分开登记,不预设单维:
1. suicidal ideation
2. suicide plan
3. suicide attempt(二元和次数形式分开)
4. self-harm(是否共模需证据)
5. sadness/hopelessness(是否共模需证据)
欺凌、孤独、睡眠、物质使用、家庭/同伴支持、暴力暴露及国家背景属于解释或分层变量,不因相关或预测作用自动变成自杀风险量表题目。横断面关联不表述为因果或个体纵向预测。
阶段 2 为每个构念选择:IRT/多维测量、阶段/潜类别/多结局、直接二分类/频数协调,或分调查报告。
## 5. 数据角色与唯一候选入口
| 数据源 | 候选角色 | 唯一候选入口 | 状态 |
|---|---|---|---|
| GSHS | 跨国开发及未见国家验证 | `Dataset/GSHS-全球学生健康调查数据/GSHS/01_data/GSHS.csv` | `audit_required` |
| YRBS | 问卷版本及时间迁移 | 处理包 `YRBS/full_by_year`19912019);原始核验用 `YRBS_National_1991_2023/raw` | `conditional` |
| NSDUH | 外部工具/总体候选 | `可直接分析数据包_NSDUH_YRBS/NSDUH/nsduh_2021_2024_full.parquet` | `conditional` |
| World Bank/WHO context | 后期国家—年份解释层 | `WHO-country_context/world_bank_country_year_1990_2025.csv` 及来源长表 | `conditional` |
| 其他目录 | 外部候选、文档或 provenance archive | 无 | 不进入核心分析,除非书面改版 |
入口是审计入口,不表示其中变量已经通过题义、总体、设计或许可审计。
## 6. 冻结的迁移任务
1. **Unseen item family**:同一家族全部措辞、翻译、回答和监督信号留出。
2. **Unseen questionnaire version**:整个版本及泄漏等价版本留出。
3. **Unseen country**:该国全部年份和组件回答留出,未知国家效应从层级分布预测并传播不确定性。
4. **Unseen region**:整个预定地区留出。
5. **Temporal extrapolation**:早期训练、后期测试,背景按预测时点可得性处理。
6. **Cross-instrument**:总体和结局定义审计通过后再跨工具评估。
随机个体划分只用于调试或辅助比较,不作为核心迁移主张证据。
## 7. 估计目标和指标层级
主要目标是题目阈值/难度、区分度、DIF、共同标度成立时的潜在表型/群体分布,以及新题目/新域的预测分布与不确定性。
共同主指标候选:未见题目家族 held-out log score;未见国家/工具共同目标上的校准或分布误差;模拟已知真值下参数恢复与覆盖;群体估计的设计加权误差与区间表现。AUPRC、AUROC、Brier 等为辅助预测指标,不能单独证明测量协调成功。
## 8. 识别和调查设计原则
- 语义相似只产生候选连接,不证明锚题不变或共同标度成立。
- 国家均值、阈值平移和无约束 DIF 可能混淆;正式模型必须声明标度、参考组、锚题和 DIF 约束。
- 独立信息单位主要是题目家族/版本及国家/工具等外层单元;大量受访者不能补偿题目种类不足。
- 保留权重、PSU、stratum、国家—年份及组件标识。
- 权重进入似然不等同于设计一致区间;描述性设计方差、模型内权重和设计型重抽样分开验证。
- 未施测、不适用、合法跳题、拒答、不知道、普通缺失和真实阴性分开。
## 9. 范围外事项
- 临床诊断、个体自杀预测或资源分配工具。
- 用国家自杀死亡率作个体结局。
- 无总体限定地把学校样本外推到全部青少年。
- 在跨构念/数据集/任务证据不足时称为 foundation model。
- 在阶段 2/3 前冻结最终深度架构、最终嵌入模型或结果后阈值。
- 把 AI 预审登记为两名人类审核者。
- 分发未经确认允许的微观数据。
## 10. 伦理、许可和治理
- 数据按去标识化二次数据处理,但使用仍受来源现行条款和机构要求约束。
- 不重新识别参与者,不公开再分发许可未确认的微数据。
- 主要结局进入确认性分析前需两名实际审核者复核;AI 检查只标 provisional。
- 输出记录 AI 辅助、数据来源、版本、哈希、模型/包版本及 unknown 状态。
- 原始数据只读;衍生产物写入 `research/`
- 改变总体、构念、数据角色、测试任务或成功判据时,必须提高本章程版本并在 `Progression.md` 记录原因。
## 11. 阶段 0 待验证清单
1. 各调查组件的年龄、在校状态、地域、语言和问卷版本。
2. 主要结局官方正文、答案标签、时间窗口、跳题和派生规则。
3. GSHS 权重、PSU、stratum 的调查级有效性。
4. YRBS 2021/2023 官方布局、导入程序、记录数和本地文件一致性。
5. NSDUH 青少年/成人/COVID/派生变量边界及正确权重/方差设计。
6. 锚题图、题目共现、阳性事件、结构缺失及有效题目家族数。
7. 各来源现行许可、引用要求及衍生数据分发范围。
8. 最接近方法文献和真实贡献边界;不得预设首创。
9. 缺失的 R、复杂抽样、PyMC/ArviZ 和心理测量环境的锁定方案。
## 12. Gate 与停止条件
Gate 0 要求本章程、数据清单、文献矩阵和环境审计齐备。Gate 1 要求正式题目均有来源、编码、总体与缺失规则且主要结局完成人工双重核查。Gate 2 要求每个构念得到可进入潜变量模型/有条件/仅直接协调/不纳入的证据判定。
官方文本或编码无法确认、图不连通/标度不可识别、题目家族不足、设计字段不完整或参数恢复失败时按工作流降级;不得通过增加模型复杂度、替换最终测试或扩大主张掩盖失败。
## 13. 输入绑定
| 输入 | SHA-256 |
|---|---|
| `Document/research-workflow.md` | `394a191359298132fc2a56304dbc49b5934f47af22d2e0fff47d28a0d9edcaeb` |
| `Document/项目的正式定位.md` | `28a415ff5d42649df2a7c68079ae0abfd295cbffb5fead216934a895cca4cd13` |
| `Document/language-conditioned-psychometric-harmonization-model.md` | `39d2050735f4df28c6abe08f8d1de6094b7ac11d0b6f2ccf9fd66d4cc450a825` |
| `research/audit/data_manifest.csv` | `0427a19c3287a2691edbd9a4486917989fe369fcb0f729a01477ce27cd8f98f2` |
| `research/audit/data_source_registry.csv` | `ac68b9928f8855c5373034a30adda316da1da2f1a1e890b0c23f836f12d55b67` |
| `research/audit/environment_audit.md` | `c84a6b05718bbaf7762021aa45b2f983e7c9ef844d41592d2138439251e929eb` |