Train ATI-HO and finalize project outputs

This commit is contained in:
2026-09-26 16:05:44 +08:00
parent a86560da64
commit 9cdd604117
358 changed files with 10540 additions and 173 deletions
+43 -25
View File
@@ -1,4 +1,4 @@
# Q1/Q2 实验结果与复现摘要
# Q1/Q2/Q3 实验结果与复现摘要
本报告汇总 `final/` 内可复核的 Q1 物理时间对齐结果和 Q2 官方未对齐数据比较。模型代码、训练命令、数据目录和依赖说明见 [README.md](README.md)。数值结果链接均指向本项目内的 CSV、JSON 或实验审计文件。
@@ -96,45 +96,63 @@ Q1 adapter 使用带媒体时戳的原生特征进行物理时间聚合;Q2 未
完整精度及审计文件:[14 个版本验证指标](output/q2/comparison_validation.csv) · [3 个正式测试结果](output/q2/comparison_test.csv) · [全部版本 AURC-MAE](output/q2/comparison_aurc.csv) · [数学运行清单](experiments/q2/unaligned_math_all_b128/run_manifest.json) · [深度学习运行清单](experiments/q2/unaligned_deep_two_b128/run_manifest.json) · [数学 42 情景明细(gzip CSV)](experiments/q2/unaligned_math_all_b128/controlled_missingness.csv.gz) · [深度学习 42 情景明细](experiments/q2/unaligned_deep_two_b128/controlled_metrics_by_scenario.csv) · [深度学习测试配对 Bootstrap](experiments/q2/unaligned_deep_two_b128/official_test_paired_bootstrap.csv)。
## Q3:分层反事实证据归因(第一轮)
## Q3:ATI–HO 锚定交互与分层 Owen 归因
Q3 将 Q1 的统一输入/回溯接口、Q2 的缺失鲁棒预测器与附件 4 原始视频接起来。附件 4 的特征按统一 adapter 的 Relative-Progress 模式转换;预测器直接复用 Q2 seed 20260924 的 EarlyConcat + BiGRU、MoFE-7 + MLP Router 检查点和仅由训练集拟合的 robust scaler,本轮不重新训练。解释覆盖附件 4 的 20 个样本;官方验证集另有 728 条样本用于复核预测指标并输出误差归因。
本轮按用户更正后的 ATI–HO 方案完成 Q3 训练与评估。输入使用官方 `unaligned_50.pkl`,经统一 Q1 adapter 转成 50 个 Relative-Progress 槽,复用仅由训练集拟合的 Q2 robust scaler。训练/验证/测试为 3,395/728/727 条,来源视频组为 1,528/239/381,组间无重叠。相对进度统一序列顺序,不代表物理时间同步。
三模态只有 8 个输入组合,因此 E0/E2 对文本、音频、视觉 coalition 完整枚举,分别计算预测类别 logit 与强度输出的精确 Shapley 贡献及成对交互。局部证据由窗口宽度 1/3/5 的反事实遮蔽得到,并回溯到特征来源行、文本片段及候选视频帧。E1 展示 MoFE Router 权重,并用同一预测器做删除/保留检验;Router 权重作为内部路由信号分析,不直接当作预测贡献。
### 训练与选型
### 预测器验证表现
Stage I 用 seed 42 训练 A0/A1/A2/A3 和未锚定诊断 D0;Stage II 对 EarlyConcat + BiGRU、MoFE-7 + MLP Router、Stage I 初选方案及两项关键消融使用 seeds 42、3407、2026。按锁定验证集四个固定遮蔽场景任务损失的三 seed 均值选择最终模型。Stage I 初选 A2;Stage II 三 seed 选出 **A0(仅锚定主效应)**:
下表为复用检查点在官方验证集自然缺失输入上的结果。E1 与 E2 使用同一个 MoFE 检查点,因此预测指标相同。
| ATI 方案 | 固定场景验证损失(均值 ± 标准差) |
|---|---:|
| A0 | **0.86580 ± 0.00920** |
| A1(秩 4 pairwise) | 0.86728 ± 0.01282 |
| A2(锚定交叉注意力) | 0.86859 ± 0.01014 |
| 方案 / 预测器 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ |
结果不支持在最终模型中保留更复杂的 pairwise 分支;A1/A2 仍作为消融完整留档。附件 4 标签未参与训练、选型和结果计算。
### 官方验证集性能
表中数值为三 seed 均值 ± 标准差;分类保留 negative/neutral/positive 三类。
| 模型 | Seeds | Accuracy ↑ | Macro-F1 ↑ | 强度 MAE ↓ | Pearson ↑ |
|---|---:|---:|---:|---:|---:|
| E0 EarlyConcat + BiGRU | **0.6236** | **0.5779** | 0.6614 | 0.8731 | **0.6092** |
| E1/E2 MoFE-7 + MLP Router | 0.6140 | 0.5661 | **0.6426** | **0.8499** | 0.6014 |
| EarlyConcat + BiGRU | 3 | 0.632 ± 0.010 | 0.594 ± 0.018 | **0.629 ± 0.008** | **0.621 ± 0.003** |
| MoFE-7 + MLP Router | 3 | 0.624 ± 0.010 | **0.598 ± 0.009** | 0.639 ± 0.004 | 0.614 ± 0.004 |
| ATI–HO A0 | 3 | **0.633 ± 0.002** | 0.593 ± 0.010 | 0.740 ± 0.015 | 0.565 ± 0.003 |
EarlyConcat 的 Accuracy/Macro-F1 点估计较高,MoFE 的 MAE/RMSE 较低。这里复核的是已训练检查点,不是 Q3 新模型训练结果;指标差别不代表显著差异。
A0 的 Accuracy 点估计略高,但 Macro-F1 接近两条基线,强度 MAE 和 Pearson 明显较弱。因此“最终选中”只表示它在预先规定的组合验证损失上均值最低,不表示它在所有指标上优于基线。
### 附件 4 解释行为检查
按验证视频组进行 1,000 次配对 Bootstrap。正值表示 ATI–HO 更好;MAE 差值定义为“基线 MAE − ATI–HO MAE”。所有区间均为 95%:
下表数值是 20 个无人工解释标签样本的均值。Comprehensiveness 是删除高排名局部证据后预测类别 logit 的下降,越大说明当前预测对所选证据越敏感;Sufficiency 是只保留高排名证据后的完整输入 logit 绝对差,越小越接近完整输入。Deletion AUC 汇总删除 0%–70% 的 logit 下降。
| 对比 | 指标 | 差值 | Bootstrap 区间 |
|---|---|---:|---:|
| A0 − EarlyConcat | Accuracy | +0.0027 | [-0.0157, 0.0218] |
| A0 − EarlyConcat | Macro-F1 | +0.0044 | [-0.0192, 0.0287] |
| EarlyConcat MAE − A0 MAE | MAE | -0.1211 | [-0.1553, -0.0892] |
| A0 − EarlyConcat | Pearson | -0.0619 | [-0.0922, -0.0338] |
| A0 − MoFE | Accuracy | +0.0000 | [-0.0177, 0.0182] |
| A0 − MoFE | Macro-F1 | -0.0118 | [-0.0329, 0.0079] |
| MoFE MAE − A0 MAE | MAE | -0.1158 | [-0.1488, -0.0835] |
| A0 − MoFE | Pearson | -0.0571 | [-0.0863, -0.0268] |
| 方案 | 删除 Top 10% ↑ | 删除 Top 30% ↑ | 仅保留 Top 10% 的绝对差 ↓ | 仅保留 Top 30% 的绝对差 ↓ | Deletion AUC ↑ | 尺度稳定性 Spearman ↑ |
|---|---:|---:|---:|---:|---:|---:|
| E0 EarlyConcat:Shapley + 局部遮蔽 | 0.4599 | **1.1218** | 0.5246 | 0.2542 | **0.9157** | 0.9047 |
| E1 MoFE:Router + 反事实检验 | 0.2100 | 0.8702 | 0.4954 | 0.2500 | 0.7925 | — |
| E2 MoFE:Shapley + 局部遮蔽 | **0.3515** | 0.9818 | **0.4116** | **0.1950** | 0.8371 | 0.8823 |
分类差异区间跨零;连续强度指标显示 A0 在当前验证组上弱于两条基线。Bootstrap 描述固定训练检查点在验证视频组上的抽样不确定性,不代表训练 seed 不确定性。
在同一 MoFE 检查点上,E2 的删除分数和 deletion AUC 高于 E1,保留证据后的绝对差更低;这说明 E2 的局部 Shapley/遮蔽排序在本批样本上比 Router utility 更贴合预测器的遮蔽响应。两者的平均模态排序 Spearman 为 0.725,主导模态一致率为 17/20(85%),Router 与反事实贡献存在一定对应,但并不相同。E0/E2 的尺度稳定性是窗口宽度 1/3/5 得分排序相关的样本均值;E1 不是多尺度遮蔽解释,故不计算该值。
### 结构与解释审计
Shapley 完备性检查覆盖分类与强度两种输出,最大绝对残差为 `4.44×10⁻¹⁶`;E1/E2 的 20 个样本预测类别、强度和类别概率逐项一致。上述 faithfulness 数值是模型响应诊断,不是人工解释准确率;删除/保留输入也可能偏离训练时的掩码分布,尤其是仅保留 10% 的情景。附件 4 没有词、音频帧或视频帧的可信时间戳;输出的视频秒数由归一化进程乘视频时长估算,只作人工回看定位,不代表物理时间对齐。遮蔽贡献也不证明现实情绪成因。
ATI 参数向量为三个居中类别 logit 与负/正条件强度参数;A0 的输出按锚定主效应加和重构,训练后最大重构残差为 0。A0–A3 的锚定结构检查通过;D0 未锚定诊断用于检查缺失模态基线泄漏。
完整结果:[Q3 方案汇总](output/q3/first_round/q3_method_comparison.csv) · [运行清单与完备性审计](output/q3/first_round/run_manifest.json) · [附件 4 预测](output/q3/first_round/attachment4_predictions.csv) · [模态 Shapley 贡献](output/q3/first_round/attachment4_modal_shapley.csv) · [跨模态交互](output/q3/first_round/attachment4_pairwise_interactions.csv) · [局部证据](output/q3/first_round/attachment4_local_evidence.csv) · [逐样本 faithfulness](output/q3/first_round/faithfulness_by_sample.csv) · [验证集指标](output/q3/first_round/validation_metrics.json) · [验证集错误归因](output/q3/first_round/validation_error_attribution.csv) · [典型解释卡](output/q3/first_round/typical_explanation_card.md)。全部 20 个样本解释卡、证据图、候选帧与 CSV 保存在 [`output/q3/first_round/`](output/q3/first_round/)。
最终 A0 在 728 条验证样本上的解析分类 Shapley 与 8 个模态联盟精确枚举通过率为 100%,最大绝对误差 6.81×10⁻⁷(容差 1e-6 绝对误差加 1e-5 相对误差)。Attachment 4 的 20 个无标签样本通过率也为 100%。类别选择和 sigmoid 解码后的强度输出为非线性量,因此强度贡献直接用 8 联盟精确枚举,没有套用参数线性分解。
### MoFE Router 热力图示例
Attachment 4 的 Hierarchical Owen 归因按三模态外层分组、每模态 10 个相对进度片段内层分组,从 8 次随机排列开始并依据稳定性增加至最多 64 次。20 个样本的最大守恒残差为 4.41×10⁻⁶。删除/保留诊断采用 10%/20%/30% 预算,并以同模态、同片段数随机选择作对照;这些数值是模型遮挡响应,不是人工解释准确率或因果效应。训练 seed 与 1% 输入扰动稳定性分别记录在 [稳定性审计表](experiments/q3/ati_ho/results/ati_ho/stability_results.csv)。
下图选取附件 4 样本 02(完整输入时 MoFE 预测中性)和样本 03(预测负向)。每个样本各展示完整输入与一组受控遮蔽:样本 02 遮蔽文本 bins 6–20 和音频 bins 19–33,样本 03 遮蔽视觉 bins 19–33。完整样本三种模态各有 50/50 个可见 bin;残缺输入是人为构造的对照,不是附件 4 的原生缺失记录。上方文本、波形和视频帧只用蓝色斜线标记被遮蔽区;下方将 T、A、V、TA、TV、AV、TAV 七个 expert 横向并排,色块/数值表示该样本的平均 Router 权重,下方窄条显示 50 个相对进程 bin 上的 α[t,e]。每个 bin 的权重在可用 expert 中归一化;非可用 expert 权重为 0。色条显示原始 0–1 分数并用平方根归一化增强低权重可见度。顶部 T/A/V 数值是跨位置的 Router exposure share。
本轮 14/20 个附件 4 样本在最多 64 次排列内满足 Owen 停止条件,平均 45.6 次。30% 删除时,ATI–HO 选中的局部片段使固定 logit margin 平均下降 0.433;同模态、同片段数随机片段下降 0.112。训练 seed 归因的平均相关为 0.252、top-5 Jaccard 为 0.380,说明细粒度位置排序存在 seed 波动;1% 输入扰动下的五个诊断样本保持了相同 top-5 证据。A0 每 seed 有 127,020 个可训练参数,三 seed 集成单样本推理约 4.842 ms;8 联盟 Shapley 约 0.044 秒/样本,Owen 约 0.131 秒/样本(RTX 5070 Ti)。这些时间只表示本轮运行环境。
样本 02 的 T/A/V exposure share 从完整输入的 35.8%/28.9%/35.2% 变为遮蔽文本与音频后的 29.9%/25.9%/44.1%,分类预测从中性变为正向。样本 03 从 35.9%/29.2%/34.9% 变为遮蔽视觉后的 39.6%/34.2%/26.2%,分类仍为负向。这些是两个受控样本的 Router 路由变化示例,不表示缺失模态的真实情绪贡献;α[t,e] 也不是反事实预测贡献。
### 题目输出和完整材料
![附件 4 完整与受控残缺样本的 MoFE Router 热力图](output/q3/mofe_router_heatmap_examples.png)
题目输出目录 `output/q3/ati_ho/` 仅放附件 4 的预测与解释交付件:`attachment4_predictions.csv`(20 行类别、强度及概率)、`attachment4_explanations.csv`(参数分解及 Shapley)、`attachment4_local_evidence.csv`(Owen 片段贡献)、`attachment4_prediction_manifest.json`(输入/模型哈希和审计范围)。附件 4 没有标签,不报告其准确率或误差。
[PNG 高清图](output/q3/mofe_router_heatmap_examples.png) · [PDF 矢量版](output/q3/mofe_router_heatmap_examples.pdf) · [逐位置 Router 分数](output/q3/mofe_router_heatmap_scores.csv) · [样本与条件摘要](output/q3/mofe_router_heatmap_summary.csv) · [热力图运行清单](output/q3/mofe_router_heatmap_manifest.json) · [可复现绘图脚本](q3/plot_router_heatmaps.py)。
工作区 `experiments/q3/ati_ho/` 保留完整候选与基线权重,以及逐 seed 指标、验证集 Shapley、Bootstrap、结构、Owen、fidelity、稳定性和复杂度结果。精简提交包包含最终 A0 三 seed 权重和完整结果表。主要文档:[实验结果](experiments/q3/ati_ho/results/ati_ho/ATI_HO_RESULTS.md) · [论文式报告](experiments/q3/ati_ho/results/ati_ho/ATI_HO_PAPER.md) · [验收摘要](experiments/q3/ati_ho/results/ati_ho/EXECUTIVE_SUMMARY.md) · [运行清单](experiments/q3/ati_ho/results/ati_ho/run_manifest.json) · [三 seed 指标表](experiments/q3/ati_ho/results/ati_ho/main_results.csv) · [视频组 Bootstrap](experiments/q3/ati_ho/results/ati_ho/bootstrap_results.csv) · [Owen 与 fidelity 明细](experiments/q3/ati_ho/results/ati_ho/owen_audit.csv) · [稳定性审计](experiments/q3/ati_ho/results/ati_ho/stability_results.csv) · [附件 4 预测](output/q3/ati_ho/attachment4_predictions.csv) · [附件 4 局部证据](output/q3/ati_ho/attachment4_local_evidence.csv)。
模型定义在 `model/ati_ho.py` 与 `model/ati_ho_config.py`,训练和评估命令见 [Q3 运行说明](q3/ati_ho/README.md)。此前 MoFE 第一轮解释与 Router 热力图已从题目输出目录移入工作区历史记录;当前 Q3 结果以 ATI–HO 为准。