Files
modeling_zhaocui/final/REPORTS.md
T

14 KiB
Raw Blame History

Q1/Q2 实验结果与复现摘要

本报告汇总 final/ 内可复核的 Q1 物理时间对齐结果和 Q2 官方未对齐数据比较。模型代码、训练命令、数据目录和依赖说明见 README.md。数值结果链接均指向本项目内的 CSV、JSON 或实验审计文件。

Q1:附件一物理时间特征

Q1 包含 100 条视频片段、37 个来源视频组。文本使用 BERT/CTC 词区间,音频为 74 维,视觉为 OpenFace 35 维;五折按 video_id 分组。表内分类指标表示情感探针表现,不是边界准确率。

分支 OOF Accuracy OOF Macro-F1 OOF MAE OOF Pearson
B0 0.5900 0.3373 0.5345 0.4255
B1 0.5700 0.3084 0.5342 0.3981
B2 0.5500 0.2769 0.5308 0.4232
B3 0.5700 0.3084 0.5202 0.4114
B4 0.6000 0.3882 0.5393 0.3413

特征包保留每条样本的模态掩码、物理时间区间、来源哈希和配置哈希。96 条样本状态为 success,4 条为 partial;部分样本因 OpenFace 有效性门控未通过而保留视觉缺失状态。Q1 完整 OOF 表 · 100 样本特征清单 · 包体审计

Q1 adapter 使用带媒体时戳的原生特征进行物理时间聚合;Q2 未对齐特征只可按归一化进程投影,两个坐标语义不混用。

Q2:附件二未对齐输入的全模型比较

统一 adapter:附件二未对齐数据全模型比较(本轮)

本轮用题目附件二 unaligned_50.pkl 作为 Q2 输入,并由 统一 adapter 的 adapt_official_split 接口统一投影。源文件 SHA-256 为 77eda14a06be9749a96c52ae45470c7cffcfa7219011eae391d231a0664c3762。比较覆盖数学分支 C0–C7 与三项 C6 单因素诊断,以及保留的 EarlyConcat + BiGRU、MoFE-7 + MLP Router;共 14 个模型版本。运行 seed 为 20260924;神经模型使用 batch size 128,C0 线性基线按各自实现训练。

附件二官方 train/valid/test 分别为 3,395/728/727 条,来源视频组数为 1,528/239/381,官方划分的视频组互不重叠。文本、音频、视觉原始特征形状分别为 (N,50,768)、(N,500,74)、(N,500,35),适配器按归一化相对进程将各模态投影至 50 个目标位置。这是相对进程投影,不代表真实秒级时间同步。适配器排除了注意力掩码外的非零文本填充行;train/valid/test 的此类行数为 86,078/17,772/18,041。视觉长度冲突样本数为 618/141/131;数据没有可信的词/帧时间戳和逐行质量字段。

两条训练路线使用相同官方数据和 adapter 输出,但各自保留预处理、训练损失及检查点选择流程,因此跨分支差异不能单独解释为融合架构的因果效果。数学分支再从 train 内部划分可靠性选择与温度校准组;深度学习分支以官方 valid 的固定遮蔽情景选择轮次。验证集用于所有模型比较;正式测试只运行内部留组选择出的数学 C6 和两种指定深度学习方案,不用测试集挑选 12 个数学变体中的赢家。

官方验证集自然缺失表现

下表为 728 条官方验证样本的自然缺失条件指标。CSV 保留完整精度。

模型 Accuracy ↑ Macro-F1 ↑ MAE ↓ RMSE ↓ Pearson ↑
C0 0.5907 0.5573 0.7268 0.9494 0.5186
C1 0.5879 0.4739 0.7446 0.9823 0.5362
C2 0.5962 0.4503 0.6982 0.9260 0.5808
C3 0.5907 0.4433 0.7318 0.9857 0.5457
C4 0.5549 0.4536 0.7454 1.0156 0.5033
C5 0.5824 0.4401 0.7788 1.0248 0.5123
C6 0.6085 0.5188 0.6847 0.9208 0.6102
C6 去距离/跨度惩罚 0.6071 0.4721 0.7118 0.9323 0.6075
C6 去辅助重构 0.5838 0.4833 0.7092 0.9543 0.5635
C6 点遮蔽 0.5810 0.5026 0.6792 0.9176 0.5959
C7 蒸馏 0.5920 0.4871 0.7025 0.9442 0.5753
C7 分组风险 0.6003 0.4509 0.7323 0.9356 0.6008
EarlyConcat + BiGRU 0.6236 0.5779 0.6614 0.8731 0.6092
MoFE-7 + MLP Router 0.6140 0.5661 0.6426 0.8499 0.6014

自然缺失验证集上,EarlyConcat 的 Accuracy 和 Macro-F1 点估计最高,MoFE 的 MAE/RMSE 最低;C6 的 Pearson 在 14 个版本中最高。数学分支内部,C0 的 Macro-F1 最高,C6 的 Accuracy/Pearson 最高,C6 点遮蔽的 MAE/RMSE 最低。以上为单种子点估计,不据此声称统计显著。

官方测试集结果

模型 Accuracy ↑ Macro-F1 ↑ MAE ↓ RMSE ↓ Pearson ↑
C6(数学分支内部选择) 0.6726 0.5485 0.7100 0.9693 0.6424
EarlyConcat + BiGRU 0.6699 0.5870 0.6851 0.9017 0.6613
MoFE-7 + MLP Router 0.6630 0.5879 0.6702 0.8895 0.6447

数学 C6 在 727 条测试样本上的 300 次来源视频组 Bootstrap 95% 区间为 Accuracy [0.6337, 0.7084]、Macro-F1 [0.5108, 0.5872]、MAE [0.6579, 0.7620]、RMSE [0.8732, 1.0580]、Pearson [0.5640, 0.7087]。EarlyConcat 与 MoFE 的 1,000 次配对来源视频组 Bootstrap 比较如下,差值定义为 MoFE − EarlyConcat:

指标 差值 95% Bootstrap 区间
Accuracy -0.0069 [-0.0303, 0.0147]
Macro-F1 +0.0009 [-0.0312, 0.0295]
MAE -0.0148 [-0.0429, 0.0136]
RMSE -0.0121 [-0.0448, 0.0191]
Pearson -0.0166 [-0.0384, 0.0053]

这五个区间均跨零。Bootstrap 以来源视频组重采样,表示当前测试组上的抽样不确定性;本轮只有一个训练 seed,不能表示不同随机种子间的波动。

连续缺失曲线表现

两条流水线均在官方验证集上评估 42 个固定遮蔽情景。下表把单模态、同步、部分重叠和异步四类 0%/10%/30%/50%/70% 遮蔽曲线压缩为归一化梯形 MAE 面积(AURC-MAE),按实际新增缺失率积分,越低越好。表中为点估计;各方案的训练目标与预处理仍有差别。

模型 单模态 同步 部分重叠 异步
C0 0.7425 0.7643 0.7578 0.7696
C1 0.7431 0.7849 0.7343 0.7406
C2 0.7279 0.7444 0.7409 0.7512
C3 0.7449 0.7573 0.7562 0.7577
C4 0.7544 0.7610 0.7660 0.7770
C5 0.7921 0.8176 0.8084 0.8118
C6 0.7028 0.7237 0.7292 0.7283
C6 去距离/跨度惩罚 0.7242 0.7387 0.7366 0.7333
C6 去辅助重构 0.7128 0.7382 0.7271 0.7429
C6 点遮蔽 0.6824 0.6988 0.6866 0.6951
C7 蒸馏 0.7215 0.7468 0.7420 0.7359
C7 分组风险 0.7437 0.7452 0.7453 0.7501
EarlyConcat + BiGRU 0.6613 0.6579 0.6493 0.6551
MoFE-7 + MLP Router 0.6509 0.6472 0.6417 0.6525

在两种深度学习方案之间,MoFE − EarlyConcat 的 AURC-MAE 配对 95% 区间分别为:单模态 -0.0104 [-0.0347, 0.0111]、同步 -0.0107 [-0.0322, 0.0093]、部分重叠 -0.0075 [-0.0280, 0.0112]、异步 -0.0026 [-0.0219, 0.0149];均跨零。数学分支 C6 的四种 AURC 点估计均低于 C0,但这是描述性点差;不把它解读为跨随机种子的稳健优势。

完整精度及审计文件:14 个版本验证指标 · 3 个正式测试结果 · 全部版本 AURC-MAE · 数学运行清单 · 深度学习运行清单 · 数学 42 情景明细(gzip CSV) · 深度学习 42 情景明细 · 深度学习测试配对 Bootstrap。

Q3:分层反事实证据归因(第一轮)

Q3 将 Q1 的统一输入/回溯接口、Q2 的缺失鲁棒预测器与附件 4 原始视频接起来。附件 4 的特征按统一 adapter 的 Relative-Progress 模式转换;预测器直接复用 Q2 seed 20260924 的 EarlyConcat + BiGRU、MoFE-7 + MLP Router 检查点和仅由训练集拟合的 robust scaler,本轮不重新训练。解释覆盖附件 4 的 20 个样本;官方验证集另有 728 条样本用于复核预测指标并输出误差归因。

三模态只有 8 个输入组合,因此 E0/E2 对文本、音频、视觉 coalition 完整枚举,分别计算预测类别 logit 与强度输出的精确 Shapley 贡献及成对交互。局部证据由窗口宽度 1/3/5 的反事实遮蔽得到,并回溯到特征来源行、文本片段及候选视频帧。E1 展示 MoFE Router 权重,并用同一预测器做删除/保留检验;Router 权重作为内部路由信号分析,不直接当作预测贡献。

预测器验证表现

下表为复用检查点在官方验证集自然缺失输入上的结果。E1 与 E2 使用同一个 MoFE 检查点,因此预测指标相同。

方案 / 预测器 Accuracy ↑ Macro-F1 ↑ MAE ↓ RMSE ↓ Pearson ↑
E0 EarlyConcat + BiGRU 0.6236 0.5779 0.6614 0.8731 0.6092
E1/E2 MoFE-7 + MLP Router 0.6140 0.5661 0.6426 0.8499 0.6014

EarlyConcat 的 Accuracy/Macro-F1 点估计较高,MoFE 的 MAE/RMSE 较低。这里复核的是已训练检查点,不是 Q3 新模型训练结果;指标差别不代表显著差异。

附件 4 解释行为检查

下表数值是 20 个无人工解释标签样本的均值。Comprehensiveness 是删除高排名局部证据后预测类别 logit 的下降,越大说明当前预测对所选证据越敏感;Sufficiency 是只保留高排名证据后的完整输入 logit 绝对差,越小越接近完整输入。Deletion AUC 汇总删除 0%–70% 的 logit 下降。

方案 删除 Top 10% ↑ 删除 Top 30% ↑ 仅保留 Top 10% 的绝对差 ↓ 仅保留 Top 30% 的绝对差 ↓ Deletion AUC ↑ 尺度稳定性 Spearman ↑
E0 EarlyConcat:Shapley + 局部遮蔽 0.4599 1.1218 0.5246 0.2542 0.9157 0.9047
E1 MoFE:Router + 反事实检验 0.2100 0.8702 0.4954 0.2500 0.7925 —
E2 MoFE:Shapley + 局部遮蔽 0.3515 0.9818 0.4116 0.1950 0.8371 0.8823

在同一 MoFE 检查点上,E2 的删除分数和 deletion AUC 高于 E1,保留证据后的绝对差更低;这说明 E2 的局部 Shapley/遮蔽排序在本批样本上比 Router utility 更贴合预测器的遮蔽响应。两者的平均模态排序 Spearman 为 0.725,主导模态一致率为 17/20(85%),Router 与反事实贡献存在一定对应,但并不相同。E0/E2 的尺度稳定性是窗口宽度 1/3/5 得分排序相关的样本均值;E1 不是多尺度遮蔽解释,故不计算该值。

Shapley 完备性检查覆盖分类与强度两种输出,最大绝对残差为 4.44×10⁻¹⁶;E1/E2 的 20 个样本预测类别、强度和类别概率逐项一致。上述 faithfulness 数值是模型响应诊断,不是人工解释准确率;删除/保留输入也可能偏离训练时的掩码分布,尤其是仅保留 10% 的情景。附件 4 没有词、音频帧或视频帧的可信时间戳;输出的视频秒数由归一化进程乘视频时长估算,只作人工回看定位,不代表物理时间对齐。遮蔽贡献也不证明现实情绪成因。

完整结果:Q3 方案汇总 · 运行清单与完备性审计 · 附件 4 预测 · 模态 Shapley 贡献 · 跨模态交互 · 局部证据 · 逐样本 faithfulness · 验证集指标 · 验证集错误归因 · 典型解释卡。全部 20 个样本解释卡、证据图、候选帧与 CSV 保存在 output/q3/first_round/。

MoFE Router 热力图示例

下图选取附件 4 样本 02(完整输入时 MoFE 预测中性)和样本 03(预测负向)。每个样本各展示完整输入与一组受控遮蔽:样本 02 遮蔽文本 bins 6–20 和音频 bins 19–33,样本 03 遮蔽视觉 bins 19–33。完整样本三种模态各有 50/50 个可见 bin;残缺输入是人为构造的对照,不是附件 4 的原生缺失记录。上方文本、波形和视频帧只用蓝色斜线标记被遮蔽区;下方将 T、A、V、TA、TV、AV、TAV 七个 expert 横向并排,色块/数值表示该样本的平均 Router 权重,下方窄条显示 50 个相对进程 bin 上的 α[t,e]。每个 bin 的权重在可用 expert 中归一化;非可用 expert 权重为 0。色条显示原始 0–1 分数并用平方根归一化增强低权重可见度。顶部 T/A/V 数值是跨位置的 Router exposure share。

样本 02 的 T/A/V exposure share 从完整输入的 35.8%/28.9%/35.2% 变为遮蔽文本与音频后的 29.9%/25.9%/44.1%,分类预测从中性变为正向。样本 03 从 35.9%/29.2%/34.9% 变为遮蔽视觉后的 39.6%/34.2%/26.2%,分类仍为负向。这些是两个受控样本的 Router 路由变化示例,不表示缺失模态的真实情绪贡献;α[t,e] 也不是反事实预测贡献。

附件 4 完整与受控残缺样本的 MoFE Router 热力图

PNG 高清图 · PDF 矢量版 · 逐位置 Router 分数 · 样本与条件摘要 · 热力图运行清单 · 可复现绘图脚本。