Files
language-conditioned-psycho…/research/protocol/literature_positioning.md
T

70 lines
4.2 KiB
Markdown

# 阶段 0 文献定位与贡献边界
日期:2026-09-20
矩阵:`literature_matrix.csv`
范围:聚焦检索,不是 PRISMA 系统综述
## 检索问题
本轮只覆盖支撑 Gate 0 的五个问题:
1. 跨调查行为/心理问卷在统计建模前需要怎样的来源和题目审核?
2. NLP/LLM 题目表示是否已经用于问卷匹配或响应结构预测?
3. 文本特征是否已经用于预测 IRT 题目参数?
4. 多组 IRT、alignment 和 DIF 如何处理多国家或不同题集?
5. Bayesian 层级模型如何处理复杂和信息性抽样?
检索优先使用期刊页面、PubMed/PMC、ACL Anthology 和论文预印本原页。无法独立确认存在或元数据的来源不进入矩阵。同行评审与预印本分开标记。
## 证据综合
### 1. 数据协调必须先做题目和来源审计
Chen 等和 Kołczyńska 的工作支持先核对研究总体、题目正文、回答选项、计分方向、版本及转换记录。它们不支持仅凭相似变量名合并,也不支持把有文档的 crosswalk 当作测量等价证据。
### 2. 语义问卷协调不是空白领域
McElroy 等已用 Sentence-BERT 比较心理健康问卷题目,并在共同作答样本中检验语义相似与实证相关。Ravenda 等进一步展示题目语义与问卷响应结构及 unseen-item 响应预测的关系。因此,本项目不能宣称首次把语言模型用于心理问卷结构或协调。
### 3. 文本预测 IRT 参数已有直接先例
BERT-IRT 已把 BERT 嵌入和工程特征用于题目参数估计。Chen 与 Chen 的预印本及 Peters 等的预印本综述进一步表明 text-to-parameter / item-difficulty modeling 已形成独立研究线,并提示目标可靠性上限、重复交叉验证和 scale-free 指标的重要性。因此,“让嵌入预测题目难度”本身不是充分创新。
### 4. 多组、跨国和不同题集协调已有成熟比较对象
Muthén 与 Asparouhov 的 alignment、Mansolf 等对不同题集/回答格式的扩展,以及 Heinz 等对 46 国青少年量表的分析,构成项目必须比较或讨论的方法基础。共同问卷也可能不满足 scalar invariance;不同题集的 alignment 仍需要预设构念结构和经验连接。
### 5. 复杂抽样不能用简单加权似然一句带过
Savitsky 与 Williams 表明,在多层信息性抽样下,只给个体 likelihood 加权仍可能不足。Wu 与 Stephenson 的综述也显示 MRP、pseudo-likelihood 和 synthetic population 各自依赖不同估计目标和设计信息。本项目必须把设计型描述性估计、模型内权重处理和设计一致的区间/重抽样检查分开。
## 当前可辩护的贡献候选
现有矩阵没有发现一项已核验工作同时完成以下组合:
- 以官方题目、回答标签、时间窗口和真实复杂抽样回答建立跨 GSHS、YRBS、NSDUH 的可追溯题库;
- 在题目家族级留出下,让多语言语义表示条件化阈值、区分度和受约束 DIF;
- 同时评估未见题目、未见问卷、未见国家/地区和时间外迁移;
- 对未见题目/国家效应传播不确定性,而不是设为零;
- 与直接协调、传统/层级 IRT、人工标签和非语义模型做公平消融;
- 明确处理权重、PSU、stratum 及设计型不确定性。
这只是阶段 0 的候选贡献边界,不是首创证明。正式论文前仍需扩大检索、做引用追踪和更新检索。
## 对研究设计的约束
1. 语义只提供候选先验或预测信息,不能替代经验锚定与可识别性。
2. 训练/测试必须按题目家族和外层域分组;单次随机划分和 RMSE 不足以支持新题目校准。
3. 对经验题目参数进行监督学习时,需传播参数估计误差或使用后验样本。
4. 若跨调查图不连通,应提出桥接样本或限制主张,不用语义相似伪造共同标度。
5. alignment 和其他传统协调方法是必要基线,不是可省略的背景文献。
6. 复杂抽样区间需独立验证;Bayesian 标签本身不保证设计一致性。
## 矩阵构成
- 总条目:13
- 同行评审:11
- 预印本:2
- 每条均记录:证据类型、数据/样本、主要结果、项目用途、限制、允许支持与不允许支持的主张、DOI/永久链接和核验状态。