17 KiB
E 题 V2:Q1 / Q2 模型与实验结果汇总
本文件汇总 E题V2.pdf 对应的 Q1、Q2 实现和正式实验结果。Q1 的算法复核见 Q1/V2_REVIEW.md,Q2 的算法复核见 Q2/V2_REVIEW.md。
Q1:模态对齐与分支探针
Q1 为 100 个样本构建 0.1 秒物理时间主网格,保留真实末段长度、逐维掩码和覆盖率;文本使用冻结 BERT 特征与 CTC 硬/后验对齐,音频提取 74 维特征,视觉使用 OpenFace 2.2.0 的 35 维特征。主特征包含 100 个样本、300 条模态明细,总计 44,321,715 字节。数据结构与读取接口见 Q1/README.md。
对 B0–B4 使用按 video_id 分组的五折 GroupKFold;100 个样本分属 37 个来源视频组,缩放器只在每折训练组上拟合。表中 Accuracy 和 Macro-F1 是按情感极性(负向、零值/中性、正向)分类的 OOF 指标,不是对齐边界准确率。
| 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF RMSE | OOF Pearson |
|---|---|---|---|---|---|
| B0 | 0.5900 | 0.3373 | 0.5345 | 0.7325 | 0.4255 |
| B1 | 0.5700 | 0.3084 | 0.5342 | 0.7444 | 0.3981 |
| B2 | 0.5500 | 0.2769 | 0.5308 | 0.7342 | 0.4232 |
| B3 | 0.5700 | 0.3084 | 0.5202 | 0.7371 | 0.4114 |
| B4 | 0.6000 | 0.3882 | 0.5393 | 0.7628 | 0.3413 |
B4 的 Accuracy 与 Macro-F1 最高;B3 的 MAE 最低。分类与回归没有由同一分支同时取得最好结果。没有人工词边界真值,因此不报告边界误差或 CTC 后验经验校准率。完整折外预测、分折指标、Bootstrap 差值与运行参数见 Q1/results/model_comparison_v2。
Q2:缺失鲁棒情感模型
Q2 使用附件二官方划分:训练集 3,395 条 / 1,528 个来源视频组,验证集 728 条 / 239 组,测试集 727 条 / 381 组;三份官方集合的来源视频组两两不重叠。结构化共享/私有状态空间补全器为 8 维共享状态加每模态 4 维私有状态;训练遮蔽率为 0、0.1、0.3、0.5、0.7,并比较 C0–C7 结构和三个单因素诊断。测试集仅用于最终一次评估。
验证集模型对照
下表为 ablation_validation.csv 中的 728 条验证样本结果。所有指标按原文件保留并四舍五入到 4 位小数;C0 是 Logistic/Ridge 基线,后续为结构消融及单因素诊断。
| 模型 | Accuracy | Macro-F1 | MAE | RMSE | Pearson |
|---|---|---|---|---|---|
| C0 | 0.5920 | 0.5559 | 0.7334 | 0.9372 | 0.5192 |
| C1 | 0.6071 | 0.5512 | 0.6780 | 0.9222 | 0.5780 |
| C2 | 0.5975 | 0.4764 | 0.7159 | 0.9473 | 0.5797 |
| C3 | 0.6085 | 0.4974 | 0.7171 | 0.9520 | 0.5966 |
| C4 | 0.6085 | 0.5551 | 0.6918 | 0.9516 | 0.5685 |
| C5(最终选定) | 0.6154 | 0.5446 | 0.6624 | 0.8933 | 0.6174 |
| C6 | 0.6264 | 0.5801 | 0.6457 | 0.8814 | 0.6157 |
| C6 无距离/跨度惩罚 | 0.6044 | 0.5145 | 0.6795 | 0.9098 | 0.6046 |
| C6 无辅助重构 | 0.6003 | 0.5178 | 0.6957 | 0.9327 | 0.5887 |
| C6 点遮蔽 | 0.6030 | 0.5513 | 0.6945 | 0.9554 | 0.5647 |
| C7 仅蒸馏 | 0.5907 | 0.5244 | 0.6743 | 0.8981 | 0.6013 |
| C7 仅组风险 | 0.6085 | 0.5117 | 0.6860 | 0.9253 | 0.5912 |
C6 在这组验证点指标中取得较高的 Accuracy、Macro-F1、MAE 和 RMSE;正式选择仍按论文实验流程中的验证选择损失执行,最终选择 C5。ablation_validation.csv 中 C5 的消融指标与正式导出的 validation_metrics.json 有小幅差异,下面正式验证结果按 JSON 原值报告;没有将两份文件的数值混合。
C5 正式验证与测试结果
| 指标 | 官方验证集 | 官方测试集 |
|---|---|---|
| Accuracy | 0.6168 | 0.6740 |
| Macro-F1 | 0.5472 | 0.5861 |
| MAE | 0.6615 | 0.6980 |
| RMSE | 0.8930 | 0.9674 |
| Pearson | 0.6176 | 0.6300 |
| Brier | 0.4918 | 0.4409 |
| 分类 NLL | 0.8373 | 0.7614 |
| ECE(15 桶) | 0.0597 | 0.0499 |
| 90% 预测区间覆盖率 | 0.8929 | 0.8968 |
| 90% 预测区间平均宽度 | 2.3819 | 2.4824 |
测试集类别支持数为负向 207、中性 158、正向 362;相应召回率为 0.7440、0.2089、0.8370。温度校准参数为 1.2127。测试集指标、预测、组 Bootstrap 区间及门控诊断见 Q2/results。
连续缺失控制与缺失类型/率的规律分析
验证集共执行 42 个固定缺失情景。C5 的归一化 AURC-MAE 及相对 C0 的差值如下;差值置信区间由来源视频组配对 Bootstrap 得到。
| 遮蔽模式 | C5 AURC-MAE | 相对 C0 差值 | 95% Bootstrap 区间 |
|---|---|---|---|
| 单模态 | 0.6696 | -0.0758 | [-0.1118, -0.0389] |
| 同步 | 0.6890 | -0.0758 | [-0.1105, -0.0417] |
| 部分重叠 | 0.6883 | -0.0774 | [-0.1146, -0.0429] |
| 异步 | 0.6880 | -0.0894 | [-0.1261, -0.0554] |
缺失率对 C5 性能的影响
以下受控遮蔽评估只在官方验证集进行(728 条、239 个来源视频组),不使用测试集选择遮蔽方案。主表模型为正式选定的 C5;所有已有 C0–C7 消融模型使用相同验证样本和相同掩码。自然缺失率约为 36.2%。新增遮蔽只作用于原本可观测的特征行。置信区间由 1,000 次来源视频组配对 Bootstrap 得到。
横轴使用论文定义的实际新增缺失率;“最终缺失率”包含 aligned 数据本来的缺失。请求遮蔽率和实际率不同,是因为音频、视频原本已有缺行,且连续区间内可遮蔽的有效行数受时间位置影响。
| 遮蔽模式 | 请求率 | 实际新增率 | 最终缺失率 | Accuracy | Macro-F1 | MAE | 相对自然缺失 ΔMAE(95% 区间) |
|---|---|---|---|---|---|---|---|
| 自然缺失 | 0% | 0.0% | 36.2% | 0.6168 | 0.5472 | 0.6615 | — |
| 单模态 | 10% | 3.4% | 38.3% | 0.6181 | 0.5489 | 0.6596 | -0.0019 [-0.0085, 0.0037] |
| 单模态 | 30% | 10.1% | 42.7% | 0.6113 | 0.5380 | 0.6692 | +0.0077 [-0.0007, 0.0163] |
| 单模态 | 50% | 16.7% | 46.7% | 0.6071 | 0.5285 | 0.6678 | +0.0063 [-0.0065, 0.0202] |
| 单模态 | 70% | 23.2% | 51.0% | 0.6085 | 0.5318 | 0.6935 | +0.0320 [0.0172, 0.0466] |
| 同步 | 10% | 5.7% | 40.6% | 0.6154 | 0.5396 | 0.6589 | -0.0025 [-0.0115, 0.0049] |
| 同步 | 30% | 18.4% | 50.0% | 0.6126 | 0.5414 | 0.6741 | +0.0126 [-0.0093, 0.0332] |
| 同步 | 50% | 33.0% | 60.1% | 0.6058 | 0.5213 | 0.6964 | +0.0349 [0.0110, 0.0627] |
| 同步 | 70% | 50.5% | 71.3% | 0.5934 | 0.5084 | 0.7390 | +0.0775 [0.0461, 0.1100] |
| 部分重叠 | 10% | 5.3% | 40.4% | 0.6181 | 0.5483 | 0.6612 | -0.0003 [-0.0117, 0.0126] |
| 部分重叠 | 30% | 14.8% | 48.7% | 0.6113 | 0.5357 | 0.6784 | +0.0169 [-0.0005, 0.0357] |
| 部分重叠 | 50% | 23.6% | 56.5% | 0.6236 | 0.5500 | 0.6918 | +0.0304 [0.0049, 0.0568] |
| 部分重叠 | 70% | 39.1% | 67.4% | 0.6058 | 0.5297 | 0.7297 | +0.0682 [0.0400, 0.1002] |
| 异步 | 10% | 5.6% | 40.4% | 0.6168 | 0.5432 | 0.6623 | +0.0008 [-0.0119, 0.0154] |
| 异步 | 30% | 17.5% | 49.4% | 0.6099 | 0.5325 | 0.6756 | +0.0142 [0.0022, 0.0269] |
| 异步 | 50% | 31.2% | 59.0% | 0.6030 | 0.5244 | 0.6998 | +0.0384 [0.0166, 0.0629] |
| 异步 | 70% | 48.3% | 70.5% | 0.6058 | 0.5185 | 0.7206 | +0.0591 [0.0311, 0.0884] |
整体上实际新增缺失率升高时,C5 的 MAE 和 Macro-F1 多数变差;样本级结果并非严格单调。到 70% 请求率时,四种模式的 MAE 增幅置信区间都高于 0;同步模式的 MAE 最高(0.7390),同时它的实际新增率也最高,因此不能把这项差异单独归因于“同步”结构。10% 请求率下,各模式的 MAE 变化区间均覆盖 0。完整曲线与每个模式的组 Bootstrap 明细见 Q2/results/controlled_missingness.csv 和 Q2/results/controlled_group_bootstrap.csv。
缺失模态类型:匹配新增缺失量
为单独比较缺失类型,另做匹配遮蔽:每个验证样本在 T、A、V、TA、TV、AV、TAV 七种条件下新增相同数量的缺失特征行,且各模态新增行数之和逐样本相同。每个样本最多新增 15 行,并按音频和视频各自的可遮蔽容量取共同上限;728 个样本中 25 个没有足够的共同容量,预算为 0。每种类型总计新增 8,932 行(平均每样本 12.27 行),遮蔽以连续时间段构造,七种类型最终总缺失率均为 44.34%。
表中“论文口径实际新增率”按各模态原本可观测行数作等模态归一,因此相同新增行数在 T/A/V 上会得到不同百分比;跨类型比较以匹配的实际新增行数为准。ΔMAE 为 C5 在该类型下相对自然缺失条件的变化;负值表示误差下降。C5–C0 为同一掩码下的配对 MAE 差值。
| 缺失类型 | 论文口径实际新增率 | C5 Accuracy | C5 Macro-F1 | C5 MAE | C5 ΔMAE vs 自然(95% 区间) | C5–C0 ΔMAE(95% 区间) |
|---|---|---|---|---|---|---|
| T | 8.2% | 0.6099 | 0.5352 | 0.6866 | +0.0251 [0.0079, 0.0450] | -0.0771 [-0.1160, -0.0355] |
| A | 19.6% | 0.6099 | 0.5341 | 0.6658 | +0.0043 [-0.0024, 0.0109] | -0.0680 [-0.1061, -0.0314] |
| V | 20.3% | 0.6209 | 0.5553 | 0.6525 | -0.0089 [-0.0181, 0.0001] | -0.0838 [-0.1220, -0.0467] |
| TA | 13.9% | 0.6154 | 0.5420 | 0.6685 | +0.0070 [-0.0105, 0.0259] | -0.0706 [-0.1077, -0.0318] |
| TV | 14.3% | 0.6071 | 0.5354 | 0.6680 | +0.0065 [-0.0057, 0.0188] | -0.0778 [-0.1175, -0.0360] |
| AV | 20.0% | 0.6181 | 0.5486 | 0.6586 | -0.0029 [-0.0093, 0.0023] | -0.0745 [-0.1117, -0.0388] |
| TAV | 16.1% | 0.6154 | 0.5436 | 0.6651 | +0.0036 [-0.0077, 0.0161] | -0.0675 [-0.1073, -0.0308] |
匹配总量后,只有 T 单模态遮蔽的 C5 MAE 增幅区间不含 0(+0.0251);其余类型的 MAE 变化区间均覆盖 0,不能据此排出稳定的模态脆弱性次序。A 单模态遮蔽的 Macro-F1 相对自然条件下降约 0.0131,配对区间为 [-0.0305, -0.0006]。七种类型下 C5 的 MAE 均低于 C0,配对差值区间均低于 0。匹配掩码逐样本审计、模型指标和组 Bootstrap 见 Q2/results/matched_missing_type.csv、matched_missing_type_audit.csv 和 matched_missing_type_bootstrap.csv;复现实验脚本为 Q2/run_matched_missing_type.py。
结构消融在缺失率曲线上的表现
上面的验证消融表给出自然条件的 Accuracy、Macro-F1、MAE 等指标;下表进一步给出四种连续遮蔽曲线上的归一化 AURC-MAE 相对 C0 的差值。负值代表平均预测误差更低。C0–C7 及单因素诊断共 12 个模型版本均使用相同 42 个验证遮蔽情景;每列的 95% 组 Bootstrap 区间见 controlled_group_bootstrap.csv。
| 模型 | 单模态 ΔAURC | 同步 ΔAURC | 部分重叠 ΔAURC | 异步 ΔAURC |
|---|---|---|---|---|
| C0 | 0.000 | 0.000 | 0.000 | 0.000 |
| C1 | -0.050 | -0.043 | -0.046 | -0.065 |
| C2 | -0.022 | -0.022 | -0.022 | -0.016 |
| C3 | -0.020 | -0.024 | -0.020 | -0.037 |
| C4 | -0.040 | -0.044 | -0.035 | -0.052 |
| C5(最终选定) | -0.076 | -0.076 | -0.077 | -0.089 |
| C6 | -0.091 | -0.092 | -0.084 | -0.108 |
| C6 无距离/跨度惩罚 | -0.062 | -0.075 | -0.073 | -0.078 |
| C6 无辅助重构 | -0.041 | -0.046 | -0.049 | -0.055 |
| C6 点遮蔽 | -0.050 | -0.063 | -0.057 | -0.072 |
| C7 仅蒸馏 | -0.061 | -0.059 | -0.055 | -0.073 |
| C7 仅组风险 | -0.041 | -0.027 | -0.026 | -0.045 |
C5 的 AURC-MAE 相对 C0 的配对 95% 区间依次为:单模态 [-0.1118, -0.0389]、同步 [-0.1105, -0.0417]、部分重叠 [-0.1146, -0.0429]、异步 [-0.1261, -0.0554],均低于 0。C6 在四条曲线上的 AURC 点估计最低;正式模型仍依论文规定按验证选择损失选择 C5。相对 C6,取消距离/跨度惩罚、辅助重构或连续遮蔽的点估计,四模式平均 AURC 分别约增加 0.022、0.046 和 0.033,支持保留这些结构与训练项。由于 aligned_50 不含逐行质量分数,质量到噪声映射消融仍不可识别。
位置、跨度与同步方式的检查
位置、长跨度/多短跨度和同步/部分重叠/异步的全部点指标与组 Bootstrap 明细也保存在 42 情景结果表中。文本模态起始/中段/末段遮蔽的实际新增率相同(约 10.1%),对应 C5 MAE 为 0.6982、0.6674、0.6767;这是描述性对比,未做位置两两的配对检验。音频和视觉自然缺行更多,同为 30% 请求率时实际新增率差异较大(例如音频起始 20.0%、末段 1.2%;视觉起始 19.3%、末段 1.2%),不据此宣称位置本身造成的因果差异。长跨度与多短跨度的同模态遮蔽、以及同步结构的实际遮蔽量同样应结合审计列阅读。
附件三有 30 条无标签样本,仅导出预测和审计,不计算 Accuracy 或 F1。aligned_50.pkl 没有逐行质量分数,因此按算法回退规则对可见行取 q*=1, J_Q=0;无人工边界或附件三标签的项目不报告虚构的监督指标。
Q1 对附件二未对齐版的适配与 Q2 探索性训练
unaligned_50.pkl 的文本为 (N,50,768),音频为 (N,500,74),视觉为 (N,500,35),但没有媒体时间戳、逐词边界或原始来源帧号。因此不能将 Q1 的 0.1 秒物理对齐主干直接用于这些特征,也不能用相同行号宣称三模态同一时刻。新增的 适配说明 和 接口 按各模态独立有效长度将索引映射到 [0,1),依据来源与 50 个目标区间的交长汇聚实际观测特征;无观测处保持缺失掩码,保存覆盖率和来源权重。该做法借鉴 Q1 区间投影形式,但因没有真实时长,不是《E题V2》式 (4.34) 的物理时间实现。下列指标只能作为索引进程近似对齐后可供 Q2 训练的证据,不能作为真实时间对齐精度。
输入审计发现,官方 vision_lengths 之后仍有非零视觉行的样本在 train/valid/test 分别为 618/141/131 条;适配器保留这些已知观测并标记长度冲突及尾部歧义。text 在 text_bert 注意力掩码外仍有非零填充行,三划分分别为 86078/17772/18041 行;适配时均排除。没有逐行质量字段,可见行只使用 q*=1, J_Q=0 回退,不制造质量分数。官方划分分别为 3395/728/727 条,来源视频组两两无交集。
将既有正式 aligned 实验选定的 C5 结构预先固定,在未对齐版 train 上从头拟合 8 轮结构化补全器和 C5(第 11 轮早停,保留第 8 轮权重),在独立训练视频组上选择可靠度并校准温度。未对齐版没有重新进行 C0–C7 结构选择,结果与 aligned 正式结果仅作描述性对照:
| 特征版本与评估集 | Accuracy | Macro-F1 | MAE | Pearson | 90% 区间覆盖率 |
|---|---|---|---|---|---|
| aligned 验证 | 0.6168 | 0.5472 | 0.6615 | 0.6176 | 0.8929 |
| 未对齐索引投影 验证 | 0.6099 | 0.5253 | 0.6701 | 0.6159 | 0.9011 |
| aligned 测试 | 0.6740 | 0.5861 | 0.6980 | 0.6300 | 0.8968 |
| 未对齐索引投影 测试 | 0.6726 | 0.5668 | 0.7059 | 0.6385 | 0.9010 |
未对齐测试集的 Accuracy 为 489/727;Macro-F1 低于 aligned 版约 0.0193,MAE 高约 0.0079。这些差异同时包含原生特征组织、近似投影与训练随机性的影响,不能单独解释为对齐算法优劣。未对齐版测试的 300 次来源视频组 Bootstrap 95% 区间为:Accuracy [0.6328, 0.7124]、Macro-F1 [0.5289, 0.6050]、MAE [0.6558, 0.7572]。C5 的最终温度为 1.0310,内层选择的可靠度候选为 (rho_imp=0.5, lambda_u=0, lambda_gap=0, lambda_span=0);完整指标、视频组区间、测试预测及运行清单见 Q2/results_unaligned。
附件三未对齐版只有 raw_text、audio 和 vision,缺少可直接给学生模型的文本数值特征及可信的音视频长度字段。按《E题V2》2.2 和 5.1.1 的接口规则,不能用原文绕过专项缺失,也不能从零尾段臆断真实长度;本轮不输出附件三未对齐版预测。取得可信长度与不泄漏缺失状态的文本数值字段后,才可按同一接口开展该专项推理。
主要结果文件
- Q1 五折模型对照:
Q1/results/model_comparison_v2/comparison_summary.csv、fold_metrics.csv、oof_predictions.csv、group_bootstrap_deltas.csv。 - Q1 特征文件与样本清单:
Q1/features_v2/。 - Q1 随机样本词到原始音频/视频位置图:
Q1/results/alignment_query_example.png;重绘脚本为Q1/visualize_alignment.py。 - Q2 验证消融与正式指标:
Q2/results/ablation_validation.csv、validation_metrics.json、test_metrics.json。 - Q2 缺失控制与组区间:
Q2/results/controlled_missingness.csv、controlled_group_bootstrap.csv、group_bootstrap_ci.csv。 - Q2 匹配缺失类型及图表:
Q2/results/matched_missing_type.csv、matched_missing_type_audit.csv、matched_missing_type_bootstrap.csv、matched_missing_type_manifest.json、aligned_missingness_effects.png;脚本见Q2/run_matched_missing_type.py和Q2/plot_missingness_effects.py。 - Q2 附件三输出:
Q2/results/attachment3_predictions.csv、attachment3_audit.csv。 - Q1 未对齐索引适配:
Q1/unaligned_adapter.py、Q1/UNALIGNED_ADAPTER.md;Q2 未对齐 C5 训练与结果:Q2/train_unaligned_c5.py、Q2/results_unaligned/。
