# Q1/Q2 实验结果与复现摘要 本报告汇总 `final/` 内可复核的 Q1 物理时间对齐结果和 Q2 官方未对齐数据比较。模型代码、训练命令、数据目录和依赖说明见 [README.md](README.md)。数值结果链接均指向本项目内的 CSV、JSON 或实验审计文件。 ## Q1:附件一物理时间特征 Q1 包含 100 条视频片段、37 个来源视频组。文本使用 BERT/CTC 词区间,音频为 74 维,视觉为 OpenFace 35 维;五折按 `video_id` 分组。表内分类指标表示情感探针表现,不是边界准确率。 | 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF Pearson | |---|---:|---:|---:|---:| | B0 | 0.5900 | 0.3373 | 0.5345 | 0.4255 | | B1 | 0.5700 | 0.3084 | 0.5342 | 0.3981 | | B2 | 0.5500 | 0.2769 | 0.5308 | 0.4232 | | B3 | 0.5700 | 0.3084 | 0.5202 | 0.4114 | | B4 | 0.6000 | 0.3882 | 0.5393 | 0.3413 | 特征包保留每条样本的模态掩码、物理时间区间、来源哈希和配置哈希。96 条样本状态为 success,4 条为 partial;部分样本因 OpenFace 有效性门控未通过而保留视觉缺失状态。[Q1 完整 OOF 表](output/q1/model_comparison/comparison_summary.csv) · [100 样本特征清单](output/q1/features_v2/manifest_q1.jsonl) · [包体审计](output/q1/package_audit.json) Q1 adapter 使用带媒体时戳的原生特征进行物理时间聚合;Q2 未对齐特征只可按归一化进程投影,两个坐标语义不混用。 ## Q2:附件二未对齐输入的全模型比较 ### 统一 adapter:附件二未对齐数据全模型比较(本轮) 本轮用题目附件二 unaligned_50.pkl 作为 Q2 输入,并由 [统一 adapter](adapter/) 的 adapt_official_split 接口统一投影。源文件 SHA-256 为 77eda14a06be9749a96c52ae45470c7cffcfa7219011eae391d231a0664c3762。比较覆盖数学分支 C0–C7 与三项 C6 单因素诊断,以及保留的 EarlyConcat + BiGRU、MoFE-7 + MLP Router;共 14 个模型版本。运行 seed 为 20260924;神经模型使用 batch size 128,C0 线性基线按各自实现训练。 附件二官方 train/valid/test 分别为 3,395/728/727 条,来源视频组数为 1,528/239/381,官方划分的视频组互不重叠。文本、音频、视觉原始特征形状分别为 (N,50,768)、(N,500,74)、(N,500,35),适配器按归一化相对进程将各模态投影至 50 个目标位置。这是相对进程投影,不代表真实秒级时间同步。适配器排除了注意力掩码外的非零文本填充行;train/valid/test 的此类行数为 86,078/17,772/18,041。视觉长度冲突样本数为 618/141/131;数据没有可信的词/帧时间戳和逐行质量字段。 两条训练路线使用相同官方数据和 adapter 输出,但各自保留预处理、训练损失及检查点选择流程,因此跨分支差异不能单独解释为融合架构的因果效果。数学分支再从 train 内部划分可靠性选择与温度校准组;深度学习分支以官方 valid 的固定遮蔽情景选择轮次。验证集用于所有模型比较;正式测试只运行内部留组选择出的数学 C6 和两种指定深度学习方案,不用测试集挑选 12 个数学变体中的赢家。 #### 官方验证集自然缺失表现 下表为 728 条官方验证样本的自然缺失条件指标。CSV 保留完整精度。 | 模型 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ | |---|---:|---:|---:|---:|---:| | C0 | 0.5907 | 0.5573 | 0.7268 | 0.9494 | 0.5186 | | C1 | 0.5879 | 0.4739 | 0.7446 | 0.9823 | 0.5362 | | C2 | 0.5962 | 0.4503 | 0.6982 | 0.9260 | 0.5808 | | C3 | 0.5907 | 0.4433 | 0.7318 | 0.9857 | 0.5457 | | C4 | 0.5549 | 0.4536 | 0.7454 | 1.0156 | 0.5033 | | C5 | 0.5824 | 0.4401 | 0.7788 | 1.0248 | 0.5123 | | C6 | 0.6085 | 0.5188 | 0.6847 | 0.9208 | **0.6102** | | C6 去距离/跨度惩罚 | 0.6071 | 0.4721 | 0.7118 | 0.9323 | 0.6075 | | C6 去辅助重构 | 0.5838 | 0.4833 | 0.7092 | 0.9543 | 0.5635 | | C6 点遮蔽 | 0.5810 | 0.5026 | 0.6792 | 0.9176 | 0.5959 | | C7 蒸馏 | 0.5920 | 0.4871 | 0.7025 | 0.9442 | 0.5753 | | C7 分组风险 | 0.6003 | 0.4509 | 0.7323 | 0.9356 | 0.6008 | | EarlyConcat + BiGRU | **0.6236** | **0.5779** | 0.6614 | 0.8731 | 0.6092 | | MoFE-7 + MLP Router | 0.6140 | 0.5661 | **0.6426** | **0.8499** | 0.6014 | 自然缺失验证集上,EarlyConcat 的 Accuracy 和 Macro-F1 点估计最高,MoFE 的 MAE/RMSE 最低;C6 的 Pearson 在 14 个版本中最高。数学分支内部,C0 的 Macro-F1 最高,C6 的 Accuracy/Pearson 最高,C6 点遮蔽的 MAE/RMSE 最低。以上为单种子点估计,不据此声称统计显著。 #### 官方测试集结果 | 模型 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ | |---|---:|---:|---:|---:|---:| | C6(数学分支内部选择) | **0.6726** | 0.5485 | 0.7100 | 0.9693 | 0.6424 | | EarlyConcat + BiGRU | 0.6699 | 0.5870 | 0.6851 | 0.9017 | **0.6613** | | MoFE-7 + MLP Router | 0.6630 | **0.5879** | **0.6702** | **0.8895** | 0.6447 | 数学 C6 在 727 条测试样本上的 300 次来源视频组 Bootstrap 95% 区间为 Accuracy [0.6337, 0.7084]、Macro-F1 [0.5108, 0.5872]、MAE [0.6579, 0.7620]、RMSE [0.8732, 1.0580]、Pearson [0.5640, 0.7087]。EarlyConcat 与 MoFE 的 1,000 次配对来源视频组 Bootstrap 比较如下,差值定义为 MoFE − EarlyConcat: | 指标 | 差值 | 95% Bootstrap 区间 | |---|---:|---:| | Accuracy | -0.0069 | [-0.0303, 0.0147] | | Macro-F1 | +0.0009 | [-0.0312, 0.0295] | | MAE | -0.0148 | [-0.0429, 0.0136] | | RMSE | -0.0121 | [-0.0448, 0.0191] | | Pearson | -0.0166 | [-0.0384, 0.0053] | 这五个区间均跨零。Bootstrap 以来源视频组重采样,表示当前测试组上的抽样不确定性;本轮只有一个训练 seed,不能表示不同随机种子间的波动。 #### 连续缺失曲线表现 两条流水线均在官方验证集上评估 42 个固定遮蔽情景。下表把单模态、同步、部分重叠和异步四类 0%/10%/30%/50%/70% 遮蔽曲线压缩为归一化梯形 MAE 面积(AURC-MAE),按实际新增缺失率积分,越低越好。表中为点估计;各方案的训练目标与预处理仍有差别。 | 模型 | 单模态 | 同步 | 部分重叠 | 异步 | |---|---:|---:|---:|---:| | C0 | 0.7425 | 0.7643 | 0.7578 | 0.7696 | | C1 | 0.7431 | 0.7849 | 0.7343 | 0.7406 | | C2 | 0.7279 | 0.7444 | 0.7409 | 0.7512 | | C3 | 0.7449 | 0.7573 | 0.7562 | 0.7577 | | C4 | 0.7544 | 0.7610 | 0.7660 | 0.7770 | | C5 | 0.7921 | 0.8176 | 0.8084 | 0.8118 | | C6 | 0.7028 | 0.7237 | 0.7292 | 0.7283 | | C6 去距离/跨度惩罚 | 0.7242 | 0.7387 | 0.7366 | 0.7333 | | C6 去辅助重构 | 0.7128 | 0.7382 | 0.7271 | 0.7429 | | C6 点遮蔽 | 0.6824 | 0.6988 | 0.6866 | 0.6951 | | C7 蒸馏 | 0.7215 | 0.7468 | 0.7420 | 0.7359 | | C7 分组风险 | 0.7437 | 0.7452 | 0.7453 | 0.7501 | | EarlyConcat + BiGRU | 0.6613 | 0.6579 | 0.6493 | 0.6551 | | MoFE-7 + MLP Router | **0.6509** | **0.6472** | **0.6417** | **0.6525** | 在两种深度学习方案之间,MoFE − EarlyConcat 的 AURC-MAE 配对 95% 区间分别为:单模态 -0.0104 [-0.0347, 0.0111]、同步 -0.0107 [-0.0322, 0.0093]、部分重叠 -0.0075 [-0.0280, 0.0112]、异步 -0.0026 [-0.0219, 0.0149];均跨零。数学分支 C6 的四种 AURC 点估计均低于 C0,但这是描述性点差;不把它解读为跨随机种子的稳健优势。 完整精度及审计文件:[14 个版本验证指标](output/q2/comparison_validation.csv) · [3 个正式测试结果](output/q2/comparison_test.csv) · [全部版本 AURC-MAE](output/q2/comparison_aurc.csv) · [数学运行清单](experiments/q2/unaligned_math_all_b128/run_manifest.json) · [深度学习运行清单](experiments/q2/unaligned_deep_two_b128/run_manifest.json) · [数学 42 情景明细(gzip CSV)](experiments/q2/unaligned_math_all_b128/controlled_missingness.csv.gz) · [深度学习 42 情景明细](experiments/q2/unaligned_deep_two_b128/controlled_metrics_by_scenario.csv) · [深度学习测试配对 Bootstrap](experiments/q2/unaligned_deep_two_b128/official_test_paired_bootstrap.csv)。 ## Q3:分层反事实证据归因(第一轮) Q3 将 Q1 的统一输入/回溯接口、Q2 的缺失鲁棒预测器与附件 4 原始视频接起来。附件 4 的特征按统一 adapter 的 Relative-Progress 模式转换;预测器直接复用 Q2 seed 20260924 的 EarlyConcat + BiGRU、MoFE-7 + MLP Router 检查点和仅由训练集拟合的 robust scaler,本轮不重新训练。解释覆盖附件 4 的 20 个样本;官方验证集另有 728 条样本用于复核预测指标并输出误差归因。 三模态只有 8 个输入组合,因此 E0/E2 对文本、音频、视觉 coalition 完整枚举,分别计算预测类别 logit 与强度输出的精确 Shapley 贡献及成对交互。局部证据由窗口宽度 1/3/5 的反事实遮蔽得到,并回溯到特征来源行、文本片段及候选视频帧。E1 展示 MoFE Router 权重,并用同一预测器做删除/保留检验;Router 权重作为内部路由信号分析,不直接当作预测贡献。 ### 预测器验证表现 下表为复用检查点在官方验证集自然缺失输入上的结果。E1 与 E2 使用同一个 MoFE 检查点,因此预测指标相同。 | 方案 / 预测器 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ | |---|---:|---:|---:|---:|---:| | E0 EarlyConcat + BiGRU | **0.6236** | **0.5779** | 0.6614 | 0.8731 | **0.6092** | | E1/E2 MoFE-7 + MLP Router | 0.6140 | 0.5661 | **0.6426** | **0.8499** | 0.6014 | EarlyConcat 的 Accuracy/Macro-F1 点估计较高,MoFE 的 MAE/RMSE 较低。这里复核的是已训练检查点,不是 Q3 新模型训练结果;指标差别不代表显著差异。 ### 附件 4 解释行为检查 下表数值是 20 个无人工解释标签样本的均值。Comprehensiveness 是删除高排名局部证据后预测类别 logit 的下降,越大说明当前预测对所选证据越敏感;Sufficiency 是只保留高排名证据后的完整输入 logit 绝对差,越小越接近完整输入。Deletion AUC 汇总删除 0%–70% 的 logit 下降。 | 方案 | 删除 Top 10% ↑ | 删除 Top 30% ↑ | 仅保留 Top 10% 的绝对差 ↓ | 仅保留 Top 30% 的绝对差 ↓ | Deletion AUC ↑ | 尺度稳定性 Spearman ↑ | |---|---:|---:|---:|---:|---:|---:| | E0 EarlyConcat:Shapley + 局部遮蔽 | 0.4599 | **1.1218** | 0.5246 | 0.2542 | **0.9157** | 0.9047 | | E1 MoFE:Router + 反事实检验 | 0.2100 | 0.8702 | 0.4954 | 0.2500 | 0.7925 | — | | E2 MoFE:Shapley + 局部遮蔽 | **0.3515** | 0.9818 | **0.4116** | **0.1950** | 0.8371 | 0.8823 | 在同一 MoFE 检查点上,E2 的删除分数和 deletion AUC 高于 E1,保留证据后的绝对差更低;这说明 E2 的局部 Shapley/遮蔽排序在本批样本上比 Router utility 更贴合预测器的遮蔽响应。两者的平均模态排序 Spearman 为 0.725,主导模态一致率为 17/20(85%),Router 与反事实贡献存在一定对应,但并不相同。E0/E2 的尺度稳定性是窗口宽度 1/3/5 得分排序相关的样本均值;E1 不是多尺度遮蔽解释,故不计算该值。 Shapley 完备性检查覆盖分类与强度两种输出,最大绝对残差为 `4.44×10⁻¹⁶`;E1/E2 的 20 个样本预测类别、强度和类别概率逐项一致。上述 faithfulness 数值是模型响应诊断,不是人工解释准确率;删除/保留输入也可能偏离训练时的掩码分布,尤其是仅保留 10% 的情景。附件 4 没有词、音频帧或视频帧的可信时间戳;输出的视频秒数由归一化进程乘视频时长估算,只作人工回看定位,不代表物理时间对齐。遮蔽贡献也不证明现实情绪成因。 完整结果:[Q3 方案汇总](output/q3/first_round/q3_method_comparison.csv) · [运行清单与完备性审计](output/q3/first_round/run_manifest.json) · [附件 4 预测](output/q3/first_round/attachment4_predictions.csv) · [模态 Shapley 贡献](output/q3/first_round/attachment4_modal_shapley.csv) · [跨模态交互](output/q3/first_round/attachment4_pairwise_interactions.csv) · [局部证据](output/q3/first_round/attachment4_local_evidence.csv) · [逐样本 faithfulness](output/q3/first_round/faithfulness_by_sample.csv) · [验证集指标](output/q3/first_round/validation_metrics.json) · [验证集错误归因](output/q3/first_round/validation_error_attribution.csv) · [典型解释卡](output/q3/first_round/typical_explanation_card.md)。全部 20 个样本解释卡、证据图、候选帧与 CSV 保存在 [`output/q3/first_round/`](output/q3/first_round/)。 ### MoFE Router 热力图示例 下图选取附件 4 样本 02(完整输入时 MoFE 预测中性)和样本 03(预测负向)。每个样本各展示完整输入与一组受控遮蔽:样本 02 遮蔽文本 bins 6–20 和音频 bins 19–33,样本 03 遮蔽视觉 bins 19–33。完整样本三种模态各有 50/50 个可见 bin;残缺输入是人为构造的对照,不是附件 4 的原生缺失记录。上方文本、波形和视频帧只用蓝色斜线标记被遮蔽区;下方将 T、A、V、TA、TV、AV、TAV 七个 expert 横向并排,色块/数值表示该样本的平均 Router 权重,下方窄条显示 50 个相对进程 bin 上的 α[t,e]。每个 bin 的权重在可用 expert 中归一化;非可用 expert 权重为 0。色条显示原始 0–1 分数并用平方根归一化增强低权重可见度。顶部 T/A/V 数值是跨位置的 Router exposure share。 样本 02 的 T/A/V exposure share 从完整输入的 35.8%/28.9%/35.2% 变为遮蔽文本与音频后的 29.9%/25.9%/44.1%,分类预测从中性变为正向。样本 03 从 35.9%/29.2%/34.9% 变为遮蔽视觉后的 39.6%/34.2%/26.2%,分类仍为负向。这些是两个受控样本的 Router 路由变化示例,不表示缺失模态的真实情绪贡献;α[t,e] 也不是反事实预测贡献。 ![附件 4 完整与受控残缺样本的 MoFE Router 热力图](output/q3/mofe_router_heatmap_examples.png) [PNG 高清图](output/q3/mofe_router_heatmap_examples.png) · [PDF 矢量版](output/q3/mofe_router_heatmap_examples.pdf) · [逐位置 Router 分数](output/q3/mofe_router_heatmap_scores.csv) · [样本与条件摘要](output/q3/mofe_router_heatmap_summary.csv) · [热力图运行清单](output/q3/mofe_router_heatmap_manifest.json) · [可复现绘图脚本](q3/plot_router_heatmaps.py)。