Files

48 lines
3.5 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Q2 后续实验协议
本文件只规定后续实验如何公平比较,不保存已经结束的实验数值或结论。当前维护的参照模型为 **EarlyConcat + BiGRU** 和 **MoFE-7 + MLP Router**。
## 固定比较条件
- 使用附件 2 的官方训练/验证划分和 `aligned_50.pkl`。每个样本的 50 个有序词片位置不能描述成 Q1 的 50 个物理时间箱。
- 两个参照模型和候选模型使用相同输入特征、显式观测掩码、训练集 median/MAD 标准化,以及相同的联合极性分类和强度回归目标。
- 训练缺失增强与验证缺失都使用连续块。验证条件包括 clean,以及 Text、Audio、Vision、Audio+Vision、All-modal 五种模式在 10%、20%、30% 缺失率下的表现。
- 默认种子为 42、3407、2026。候选模型必须与两个参照使用相同的划分、种子和验证条件。
- 分别报告 Accuracy、Macro-F1、MAE、Pearson;同时报告相对 clean 的变化、平均缺失表现、最差条件和跨种子均值/标准差。主对比可按来源视频 ID 做成对 bootstrap。
- 不合并指标构造手工总分;测试标签不得用于训练、模型选择或超参数选择。
## 参照资产与新实验目录
当前保留的模型检查点和训练集标准化参数在 `outputs/mofe_7experts/`。该目录作为只读参照保存;不要把新实验结果写入其中。每一轮实验都使用唯一子目录:
```text
outputs/followups/<编号_简短假设>/
```
训练入口示例:
```bash
uv run python -m q2.train_mofe \
--phase full --seeds 42 3407 2026 \
--output-dir outputs/followups/F01_local_repair
```
每轮只改变一个主要因素。开始训练前先记录假设、唯一改动、预期指标和停止规则;一次改变多个因素时,要拆成能够分别归因的运行。
## 增加任务专属 Router 的前置条件
在训练 dual-router 前,先运行 `uv run python -m q2.task_preference`,用保留的 single-router 检查点评估七个模态子集 expert 对分类 Macro-F1、回归 MAE 和 Pearson 的偏好。某个子集可用时强制使用该 expert;不可用时沿用已训练 router 的可用 expert 路由,并报告覆盖比例。若分类和回归的 expert 排名基本一致,或赢家不具备跨 seed 稳定性,就停止在诊断阶段,不增加第二个 Router。
若未来数据支持稳定的任务偏好分化,再按单因素顺序评估 dual-router:先比较 shared-expert/shared-BiGRU 主模型与 single-router;再比较参数量匹配的加宽 single-router;之后才评估小型 task adapter 或共享首层的 Router。沿用相同输入特征、mask、训练目标、三 seed 和验证条件,并报告分类及回归指标,不以单一综合分决定升级。当前 forced-expert 诊断没有显示稳定分化,详情见 `outputs/followups/D0_task_preference/task_preference_diagnostic.md`。
## 每轮记录
每个实验目录至少保存:
- `hypothesis.md`:研究问题、单一改动和预期现象;
- `run_manifest.json`:代码版本、配置、输入特征、划分、种子、设备和检查点来源;
- `metrics_by_condition.csv`、`summary.csv` 和 `paired_bootstrap.csv`;
- 对应模型检查点、训练历史,以及解释结果所需的诊断图。
每轮结束时说明:候选模型是否改善平均缺失表现和最差条件;clean 表现是否下降;收益是否跨种子稳定;增加的参数量与训练成本是否值得。若收益只出现在单一缺失模式,应将它报告为该模式的专门化表现,不据此直接替换整体主模型。