Files
modeling_zhaocui/final/REPORTS.md
T

7.9 KiB
Raw Blame History

Q1/Q2 实验结果与复现摘要

本报告汇总 final/ 内可复核的 Q1 物理时间对齐结果和 Q2 官方未对齐数据比较。模型代码、训练命令、数据目录和依赖说明见 README.md。数值结果链接均指向本项目内的 CSV、JSON 或实验审计文件。

Q1:附件一物理时间特征

Q1 包含 100 条视频片段、37 个来源视频组。文本使用 BERT/CTC 词区间,音频为 74 维,视觉为 OpenFace 35 维;五折按 video_id 分组。表内分类指标表示情感探针表现,不是边界准确率。

分支 OOF Accuracy OOF Macro-F1 OOF MAE OOF Pearson
B0 0.5900 0.3373 0.5345 0.4255
B1 0.5700 0.3084 0.5342 0.3981
B2 0.5500 0.2769 0.5308 0.4232
B3 0.5700 0.3084 0.5202 0.4114
B4 0.6000 0.3882 0.5393 0.3413

特征包保留每条样本的模态掩码、物理时间区间、来源哈希和配置哈希。96 条样本状态为 success,4 条为 partial;部分样本因 OpenFace 有效性门控未通过而保留视觉缺失状态。Q1 完整 OOF 表 · 100 样本特征清单 · 包体审计

Q1 adapter 使用带媒体时戳的原生特征进行物理时间聚合;Q2 未对齐特征只可按归一化进程投影,两个坐标语义不混用。

Q2:附件二未对齐输入的全模型比较

统一 adapter:附件二未对齐数据全模型比较(本轮)

本轮用题目附件二 unaligned_50.pkl 作为 Q2 输入,并由 统一 adapter 的 adapt_official_split 接口统一投影。源文件 SHA-256 为 77eda14a06be9749a96c52ae45470c7cffcfa7219011eae391d231a0664c3762。比较覆盖数学分支 C0–C7 与三项 C6 单因素诊断,以及保留的 EarlyConcat + BiGRU、MoFE-7 + MLP Router;共 14 个模型版本。运行 seed 为 20260924;神经模型使用 batch size 128,C0 线性基线按各自实现训练。

附件二官方 train/valid/test 分别为 3,395/728/727 条,来源视频组数为 1,528/239/381,官方划分的视频组互不重叠。文本、音频、视觉原始特征形状分别为 (N,50,768)、(N,500,74)、(N,500,35),适配器按归一化相对进程将各模态投影至 50 个目标位置。这是相对进程投影,不代表真实秒级时间同步。适配器排除了注意力掩码外的非零文本填充行;train/valid/test 的此类行数为 86,078/17,772/18,041。视觉长度冲突样本数为 618/141/131;数据没有可信的词/帧时间戳和逐行质量字段。

两条训练路线使用相同官方数据和 adapter 输出,但各自保留预处理、训练损失及检查点选择流程,因此跨分支差异不能单独解释为融合架构的因果效果。数学分支再从 train 内部划分可靠性选择与温度校准组;深度学习分支以官方 valid 的固定遮蔽情景选择轮次。验证集用于所有模型比较;正式测试只运行内部留组选择出的数学 C6 和两种指定深度学习方案,不用测试集挑选 12 个数学变体中的赢家。

官方验证集自然缺失表现

下表为 728 条官方验证样本的自然缺失条件指标。CSV 保留完整精度。

模型 Accuracy ↑ Macro-F1 ↑ MAE ↓ RMSE ↓ Pearson ↑
C0 0.5907 0.5573 0.7268 0.9494 0.5186
C1 0.5879 0.4739 0.7446 0.9823 0.5362
C2 0.5962 0.4503 0.6982 0.9260 0.5808
C3 0.5907 0.4433 0.7318 0.9857 0.5457
C4 0.5549 0.4536 0.7454 1.0156 0.5033
C5 0.5824 0.4401 0.7788 1.0248 0.5123
C6 0.6085 0.5188 0.6847 0.9208 0.6102
C6 去距离/跨度惩罚 0.6071 0.4721 0.7118 0.9323 0.6075
C6 去辅助重构 0.5838 0.4833 0.7092 0.9543 0.5635
C6 点遮蔽 0.5810 0.5026 0.6792 0.9176 0.5959
C7 蒸馏 0.5920 0.4871 0.7025 0.9442 0.5753
C7 分组风险 0.6003 0.4509 0.7323 0.9356 0.6008
EarlyConcat + BiGRU 0.6236 0.5779 0.6614 0.8731 0.6092
MoFE-7 + MLP Router 0.6140 0.5661 0.6426 0.8499 0.6014

自然缺失验证集上,EarlyConcat 的 Accuracy 和 Macro-F1 点估计最高,MoFE 的 MAE/RMSE 最低;C6 的 Pearson 在 14 个版本中最高。数学分支内部,C0 的 Macro-F1 最高,C6 的 Accuracy/Pearson 最高,C6 点遮蔽的 MAE/RMSE 最低。以上为单种子点估计,不据此声称统计显著。

官方测试集结果

模型 Accuracy ↑ Macro-F1 ↑ MAE ↓ RMSE ↓ Pearson ↑
C6(数学分支内部选择) 0.6726 0.5485 0.7100 0.9693 0.6424
EarlyConcat + BiGRU 0.6699 0.5870 0.6851 0.9017 0.6613
MoFE-7 + MLP Router 0.6630 0.5879 0.6702 0.8895 0.6447

数学 C6 在 727 条测试样本上的 300 次来源视频组 Bootstrap 95% 区间为 Accuracy [0.6337, 0.7084]、Macro-F1 [0.5108, 0.5872]、MAE [0.6579, 0.7620]、RMSE [0.8732, 1.0580]、Pearson [0.5640, 0.7087]。EarlyConcat 与 MoFE 的 1,000 次配对来源视频组 Bootstrap 比较如下,差值定义为 MoFE − EarlyConcat:

指标 差值 95% Bootstrap 区间
Accuracy -0.0069 [-0.0303, 0.0147]
Macro-F1 +0.0009 [-0.0312, 0.0295]
MAE -0.0148 [-0.0429, 0.0136]
RMSE -0.0121 [-0.0448, 0.0191]
Pearson -0.0166 [-0.0384, 0.0053]

这五个区间均跨零。Bootstrap 以来源视频组重采样,表示当前测试组上的抽样不确定性;本轮只有一个训练 seed,不能表示不同随机种子间的波动。

连续缺失曲线表现

两条流水线均在官方验证集上评估 42 个固定遮蔽情景。下表把单模态、同步、部分重叠和异步四类 0%/10%/30%/50%/70% 遮蔽曲线压缩为归一化梯形 MAE 面积(AURC-MAE),按实际新增缺失率积分,越低越好。表中为点估计;各方案的训练目标与预处理仍有差别。

模型 单模态 同步 部分重叠 异步
C0 0.7425 0.7643 0.7578 0.7696
C1 0.7431 0.7849 0.7343 0.7406
C2 0.7279 0.7444 0.7409 0.7512
C3 0.7449 0.7573 0.7562 0.7577
C4 0.7544 0.7610 0.7660 0.7770
C5 0.7921 0.8176 0.8084 0.8118
C6 0.7028 0.7237 0.7292 0.7283
C6 去距离/跨度惩罚 0.7242 0.7387 0.7366 0.7333
C6 去辅助重构 0.7128 0.7382 0.7271 0.7429
C6 点遮蔽 0.6824 0.6988 0.6866 0.6951
C7 蒸馏 0.7215 0.7468 0.7420 0.7359
C7 分组风险 0.7437 0.7452 0.7453 0.7501
EarlyConcat + BiGRU 0.6613 0.6579 0.6493 0.6551
MoFE-7 + MLP Router 0.6509 0.6472 0.6417 0.6525

在两种深度学习方案之间,MoFE − EarlyConcat 的 AURC-MAE 配对 95% 区间分别为:单模态 -0.0104 [-0.0347, 0.0111]、同步 -0.0107 [-0.0322, 0.0093]、部分重叠 -0.0075 [-0.0280, 0.0112]、异步 -0.0026 [-0.0219, 0.0149];均跨零。数学分支 C6 的四种 AURC 点估计均低于 C0,但这是描述性点差;不把它解读为跨随机种子的稳健优势。

完整精度及审计文件:14 个版本验证指标 · 3 个正式测试结果 · 全部版本 AURC-MAE · 数学运行清单 · 深度学习运行清单 · 数学 42 情景明细(gzip CSV) · 深度学习 42 情景明细 · 深度学习测试配对 Bootstrap。