3.5 KiB
Q2 后续实验协议
本文件只规定后续实验如何公平比较,不保存已经结束的实验数值或结论。当前维护的参照模型为 EarlyConcat + BiGRU 和 MoFE-7 + MLP Router。
固定比较条件
- 使用附件 2 的官方训练/验证划分和
aligned_50.pkl。每个样本的 50 个有序词片位置不能描述成 Q1 的 50 个物理时间箱。 - 两个参照模型和候选模型使用相同输入特征、显式观测掩码、训练集 median/MAD 标准化,以及相同的联合极性分类和强度回归目标。
- 训练缺失增强与验证缺失都使用连续块。验证条件包括 clean,以及 Text、Audio、Vision、Audio+Vision、All-modal 五种模式在 10%、20%、30% 缺失率下的表现。
- 默认种子为 42、3407、2026。候选模型必须与两个参照使用相同的划分、种子和验证条件。
- 分别报告 Accuracy、Macro-F1、MAE、Pearson;同时报告相对 clean 的变化、平均缺失表现、最差条件和跨种子均值/标准差。主对比可按来源视频 ID 做成对 bootstrap。
- 不合并指标构造手工总分;测试标签不得用于训练、模型选择或超参数选择。
参照资产与新实验目录
当前保留的模型检查点和训练集标准化参数在 outputs/mofe_7experts/。该目录作为只读参照保存;不要把新实验结果写入其中。每一轮实验都使用唯一子目录:
outputs/followups/<编号_简短假设>/
训练入口示例:
uv run python -m q2.train_mofe \
--phase full --seeds 42 3407 2026 \
--output-dir outputs/followups/F01_local_repair
每轮只改变一个主要因素。开始训练前先记录假设、唯一改动、预期指标和停止规则;一次改变多个因素时,要拆成能够分别归因的运行。
增加任务专属 Router 的前置条件
在训练 dual-router 前,先运行 uv run python -m q2.task_preference,用保留的 single-router 检查点评估七个模态子集 expert 对分类 Macro-F1、回归 MAE 和 Pearson 的偏好。某个子集可用时强制使用该 expert;不可用时沿用已训练 router 的可用 expert 路由,并报告覆盖比例。若分类和回归的 expert 排名基本一致,或赢家不具备跨 seed 稳定性,就停止在诊断阶段,不增加第二个 Router。
若未来数据支持稳定的任务偏好分化,再按单因素顺序评估 dual-router:先比较 shared-expert/shared-BiGRU 主模型与 single-router;再比较参数量匹配的加宽 single-router;之后才评估小型 task adapter 或共享首层的 Router。沿用相同输入特征、mask、训练目标、三 seed 和验证条件,并报告分类及回归指标,不以单一综合分决定升级。当前 forced-expert 诊断没有显示稳定分化,详情见 outputs/followups/D0_task_preference/task_preference_diagnostic.md。
每轮记录
每个实验目录至少保存:
hypothesis.md:研究问题、单一改动和预期现象;run_manifest.json:代码版本、配置、输入特征、划分、种子、设备和检查点来源;metrics_by_condition.csv、summary.csv和paired_bootstrap.csv;- 对应模型检查点、训练历史,以及解释结果所需的诊断图。
每轮结束时说明:候选模型是否改善平均缺失表现和最差条件;clean 表现是否下降;收益是否跨种子稳定;增加的参数量与训练成本是否值得。若收益只出现在单一缺失模式,应将它报告为该模式的专门化表现,不据此直接替换整体主模型。