Files
modeling_zhaocui/math/E题V2_Q1_Q2模型结果汇总.md

17 KiB
Raw Permalink Blame History

E 题 V2:Q1 / Q2 模型与实验结果汇总

本文件汇总 E题V2.pdf 对应的 Q1、Q2 实现和正式实验结果。Q1 的算法复核见 Q1/V2_REVIEW.md,Q2 的算法复核见 Q2/V2_REVIEW.md。

Q1:模态对齐与分支探针

Q1 为 100 个样本构建 0.1 秒物理时间主网格,保留真实末段长度、逐维掩码和覆盖率;文本使用冻结 BERT 特征与 CTC 硬/后验对齐,音频提取 74 维特征,视觉使用 OpenFace 2.2.0 的 35 维特征。主特征包含 100 个样本、300 条模态明细,总计 44,321,715 字节。数据结构与读取接口见 Q1/README.md。

对 B0–B4 使用按 video_id 分组的五折 GroupKFold;100 个样本分属 37 个来源视频组,缩放器只在每折训练组上拟合。表中 Accuracy 和 Macro-F1 是按情感极性(负向、零值/中性、正向)分类的 OOF 指标,不是对齐边界准确率。

分支 OOF Accuracy OOF Macro-F1 OOF MAE OOF RMSE OOF Pearson
B0 0.5900 0.3373 0.5345 0.7325 0.4255
B1 0.5700 0.3084 0.5342 0.7444 0.3981
B2 0.5500 0.2769 0.5308 0.7342 0.4232
B3 0.5700 0.3084 0.5202 0.7371 0.4114
B4 0.6000 0.3882 0.5393 0.7628 0.3413

B4 的 Accuracy 与 Macro-F1 最高;B3 的 MAE 最低。分类与回归没有由同一分支同时取得最好结果。没有人工词边界真值,因此不报告边界误差或 CTC 后验经验校准率。完整折外预测、分折指标、Bootstrap 差值与运行参数见 Q1/results/model_comparison_v2。

Q2:缺失鲁棒情感模型

Q2 使用附件二官方划分:训练集 3,395 条 / 1,528 个来源视频组,验证集 728 条 / 239 组,测试集 727 条 / 381 组;三份官方集合的来源视频组两两不重叠。结构化共享/私有状态空间补全器为 8 维共享状态加每模态 4 维私有状态;训练遮蔽率为 0、0.1、0.3、0.5、0.7,并比较 C0–C7 结构和三个单因素诊断。测试集仅用于最终一次评估。

验证集模型对照

下表为 ablation_validation.csv 中的 728 条验证样本结果。所有指标按原文件保留并四舍五入到 4 位小数;C0 是 Logistic/Ridge 基线,后续为结构消融及单因素诊断。

模型 Accuracy Macro-F1 MAE RMSE Pearson
C0 0.5920 0.5559 0.7334 0.9372 0.5192
C1 0.6071 0.5512 0.6780 0.9222 0.5780
C2 0.5975 0.4764 0.7159 0.9473 0.5797
C3 0.6085 0.4974 0.7171 0.9520 0.5966
C4 0.6085 0.5551 0.6918 0.9516 0.5685
C5(最终选定) 0.6154 0.5446 0.6624 0.8933 0.6174
C6 0.6264 0.5801 0.6457 0.8814 0.6157
C6 无距离/跨度惩罚 0.6044 0.5145 0.6795 0.9098 0.6046
C6 无辅助重构 0.6003 0.5178 0.6957 0.9327 0.5887
C6 点遮蔽 0.6030 0.5513 0.6945 0.9554 0.5647
C7 仅蒸馏 0.5907 0.5244 0.6743 0.8981 0.6013
C7 仅组风险 0.6085 0.5117 0.6860 0.9253 0.5912

C6 在这组验证点指标中取得较高的 Accuracy、Macro-F1、MAE 和 RMSE;正式选择仍按论文实验流程中的验证选择损失执行,最终选择 C5。ablation_validation.csv 中 C5 的消融指标与正式导出的 validation_metrics.json 有小幅差异,下面正式验证结果按 JSON 原值报告;没有将两份文件的数值混合。

C5 正式验证与测试结果

指标 官方验证集 官方测试集
Accuracy 0.6168 0.6740
Macro-F1 0.5472 0.5861
MAE 0.6615 0.6980
RMSE 0.8930 0.9674
Pearson 0.6176 0.6300
Brier 0.4918 0.4409
分类 NLL 0.8373 0.7614
ECE(15 桶) 0.0597 0.0499
90% 预测区间覆盖率 0.8929 0.8968
90% 预测区间平均宽度 2.3819 2.4824

测试集类别支持数为负向 207、中性 158、正向 362;相应召回率为 0.7440、0.2089、0.8370。温度校准参数为 1.2127。测试集指标、预测、组 Bootstrap 区间及门控诊断见 Q2/results。

连续缺失控制与缺失类型/率的规律分析

验证集共执行 42 个固定缺失情景。C5 的归一化 AURC-MAE 及相对 C0 的差值如下;差值置信区间由来源视频组配对 Bootstrap 得到。

遮蔽模式 C5 AURC-MAE 相对 C0 差值 95% Bootstrap 区间
单模态 0.6696 -0.0758 [-0.1118, -0.0389]
同步 0.6890 -0.0758 [-0.1105, -0.0417]
部分重叠 0.6883 -0.0774 [-0.1146, -0.0429]
异步 0.6880 -0.0894 [-0.1261, -0.0554]

缺失率对 C5 性能的影响

以下受控遮蔽评估只在官方验证集进行(728 条、239 个来源视频组),不使用测试集选择遮蔽方案。主表模型为正式选定的 C5;所有已有 C0–C7 消融模型使用相同验证样本和相同掩码。自然缺失率约为 36.2%。新增遮蔽只作用于原本可观测的特征行。置信区间由 1,000 次来源视频组配对 Bootstrap 得到。

横轴使用论文定义的实际新增缺失率;“最终缺失率”包含 aligned 数据本来的缺失。请求遮蔽率和实际率不同,是因为音频、视频原本已有缺行,且连续区间内可遮蔽的有效行数受时间位置影响。

对齐数据缺失率和匹配缺失类型的验证结果

遮蔽模式 请求率 实际新增率 最终缺失率 Accuracy Macro-F1 MAE 相对自然缺失 ΔMAE(95% 区间)
自然缺失 0% 0.0% 36.2% 0.6168 0.5472 0.6615 —
单模态 10% 3.4% 38.3% 0.6181 0.5489 0.6596 -0.0019 [-0.0085, 0.0037]
单模态 30% 10.1% 42.7% 0.6113 0.5380 0.6692 +0.0077 [-0.0007, 0.0163]
单模态 50% 16.7% 46.7% 0.6071 0.5285 0.6678 +0.0063 [-0.0065, 0.0202]
单模态 70% 23.2% 51.0% 0.6085 0.5318 0.6935 +0.0320 [0.0172, 0.0466]
同步 10% 5.7% 40.6% 0.6154 0.5396 0.6589 -0.0025 [-0.0115, 0.0049]
同步 30% 18.4% 50.0% 0.6126 0.5414 0.6741 +0.0126 [-0.0093, 0.0332]
同步 50% 33.0% 60.1% 0.6058 0.5213 0.6964 +0.0349 [0.0110, 0.0627]
同步 70% 50.5% 71.3% 0.5934 0.5084 0.7390 +0.0775 [0.0461, 0.1100]
部分重叠 10% 5.3% 40.4% 0.6181 0.5483 0.6612 -0.0003 [-0.0117, 0.0126]
部分重叠 30% 14.8% 48.7% 0.6113 0.5357 0.6784 +0.0169 [-0.0005, 0.0357]
部分重叠 50% 23.6% 56.5% 0.6236 0.5500 0.6918 +0.0304 [0.0049, 0.0568]
部分重叠 70% 39.1% 67.4% 0.6058 0.5297 0.7297 +0.0682 [0.0400, 0.1002]
异步 10% 5.6% 40.4% 0.6168 0.5432 0.6623 +0.0008 [-0.0119, 0.0154]
异步 30% 17.5% 49.4% 0.6099 0.5325 0.6756 +0.0142 [0.0022, 0.0269]
异步 50% 31.2% 59.0% 0.6030 0.5244 0.6998 +0.0384 [0.0166, 0.0629]
异步 70% 48.3% 70.5% 0.6058 0.5185 0.7206 +0.0591 [0.0311, 0.0884]

整体上实际新增缺失率升高时,C5 的 MAE 和 Macro-F1 多数变差;样本级结果并非严格单调。到 70% 请求率时,四种模式的 MAE 增幅置信区间都高于 0;同步模式的 MAE 最高(0.7390),同时它的实际新增率也最高,因此不能把这项差异单独归因于“同步”结构。10% 请求率下,各模式的 MAE 变化区间均覆盖 0。完整曲线与每个模式的组 Bootstrap 明细见 Q2/results/controlled_missingness.csv 和 Q2/results/controlled_group_bootstrap.csv。

缺失模态类型:匹配新增缺失量

为单独比较缺失类型,另做匹配遮蔽:每个验证样本在 T、A、V、TA、TV、AV、TAV 七种条件下新增相同数量的缺失特征行,且各模态新增行数之和逐样本相同。每个样本最多新增 15 行,并按音频和视频各自的可遮蔽容量取共同上限;728 个样本中 25 个没有足够的共同容量,预算为 0。每种类型总计新增 8,932 行(平均每样本 12.27 行),遮蔽以连续时间段构造,七种类型最终总缺失率均为 44.34%。

表中“论文口径实际新增率”按各模态原本可观测行数作等模态归一,因此相同新增行数在 T/A/V 上会得到不同百分比;跨类型比较以匹配的实际新增行数为准。ΔMAE 为 C5 在该类型下相对自然缺失条件的变化;负值表示误差下降。C5–C0 为同一掩码下的配对 MAE 差值。

缺失类型 论文口径实际新增率 C5 Accuracy C5 Macro-F1 C5 MAE C5 ΔMAE vs 自然(95% 区间) C5–C0 ΔMAE(95% 区间)
T 8.2% 0.6099 0.5352 0.6866 +0.0251 [0.0079, 0.0450] -0.0771 [-0.1160, -0.0355]
A 19.6% 0.6099 0.5341 0.6658 +0.0043 [-0.0024, 0.0109] -0.0680 [-0.1061, -0.0314]
V 20.3% 0.6209 0.5553 0.6525 -0.0089 [-0.0181, 0.0001] -0.0838 [-0.1220, -0.0467]
TA 13.9% 0.6154 0.5420 0.6685 +0.0070 [-0.0105, 0.0259] -0.0706 [-0.1077, -0.0318]
TV 14.3% 0.6071 0.5354 0.6680 +0.0065 [-0.0057, 0.0188] -0.0778 [-0.1175, -0.0360]
AV 20.0% 0.6181 0.5486 0.6586 -0.0029 [-0.0093, 0.0023] -0.0745 [-0.1117, -0.0388]
TAV 16.1% 0.6154 0.5436 0.6651 +0.0036 [-0.0077, 0.0161] -0.0675 [-0.1073, -0.0308]

匹配总量后,只有 T 单模态遮蔽的 C5 MAE 增幅区间不含 0(+0.0251);其余类型的 MAE 变化区间均覆盖 0,不能据此排出稳定的模态脆弱性次序。A 单模态遮蔽的 Macro-F1 相对自然条件下降约 0.0131,配对区间为 [-0.0305, -0.0006]。七种类型下 C5 的 MAE 均低于 C0,配对差值区间均低于 0。匹配掩码逐样本审计、模型指标和组 Bootstrap 见 Q2/results/matched_missing_type.csv、matched_missing_type_audit.csv 和 matched_missing_type_bootstrap.csv;复现实验脚本为 Q2/run_matched_missing_type.py。

结构消融在缺失率曲线上的表现

上面的验证消融表给出自然条件的 Accuracy、Macro-F1、MAE 等指标;下表进一步给出四种连续遮蔽曲线上的归一化 AURC-MAE 相对 C0 的差值。负值代表平均预测误差更低。C0–C7 及单因素诊断共 12 个模型版本均使用相同 42 个验证遮蔽情景;每列的 95% 组 Bootstrap 区间见 controlled_group_bootstrap.csv。

模型 单模态 ΔAURC 同步 ΔAURC 部分重叠 ΔAURC 异步 ΔAURC
C0 0.000 0.000 0.000 0.000
C1 -0.050 -0.043 -0.046 -0.065
C2 -0.022 -0.022 -0.022 -0.016
C3 -0.020 -0.024 -0.020 -0.037
C4 -0.040 -0.044 -0.035 -0.052
C5(最终选定) -0.076 -0.076 -0.077 -0.089
C6 -0.091 -0.092 -0.084 -0.108
C6 无距离/跨度惩罚 -0.062 -0.075 -0.073 -0.078
C6 无辅助重构 -0.041 -0.046 -0.049 -0.055
C6 点遮蔽 -0.050 -0.063 -0.057 -0.072
C7 仅蒸馏 -0.061 -0.059 -0.055 -0.073
C7 仅组风险 -0.041 -0.027 -0.026 -0.045

C5 的 AURC-MAE 相对 C0 的配对 95% 区间依次为:单模态 [-0.1118, -0.0389]、同步 [-0.1105, -0.0417]、部分重叠 [-0.1146, -0.0429]、异步 [-0.1261, -0.0554],均低于 0。C6 在四条曲线上的 AURC 点估计最低;正式模型仍依论文规定按验证选择损失选择 C5。相对 C6,取消距离/跨度惩罚、辅助重构或连续遮蔽的点估计,四模式平均 AURC 分别约增加 0.022、0.046 和 0.033,支持保留这些结构与训练项。由于 aligned_50 不含逐行质量分数,质量到噪声映射消融仍不可识别。

位置、跨度与同步方式的检查

位置、长跨度/多短跨度和同步/部分重叠/异步的全部点指标与组 Bootstrap 明细也保存在 42 情景结果表中。文本模态起始/中段/末段遮蔽的实际新增率相同(约 10.1%),对应 C5 MAE 为 0.6982、0.6674、0.6767;这是描述性对比,未做位置两两的配对检验。音频和视觉自然缺行更多,同为 30% 请求率时实际新增率差异较大(例如音频起始 20.0%、末段 1.2%;视觉起始 19.3%、末段 1.2%),不据此宣称位置本身造成的因果差异。长跨度与多短跨度的同模态遮蔽、以及同步结构的实际遮蔽量同样应结合审计列阅读。

附件三有 30 条无标签样本,仅导出预测和审计,不计算 Accuracy 或 F1。aligned_50.pkl 没有逐行质量分数,因此按算法回退规则对可见行取 q*=1, J_Q=0;无人工边界或附件三标签的项目不报告虚构的监督指标。

Q1 对附件二未对齐版的适配与 Q2 探索性训练

unaligned_50.pkl 的文本为 (N,50,768),音频为 (N,500,74),视觉为 (N,500,35),但没有媒体时间戳、逐词边界或原始来源帧号。因此不能将 Q1 的 0.1 秒物理对齐主干直接用于这些特征,也不能用相同行号宣称三模态同一时刻。新增的 适配说明 和 接口 按各模态独立有效长度将索引映射到 [0,1),依据来源与 50 个目标区间的交长汇聚实际观测特征;无观测处保持缺失掩码,保存覆盖率和来源权重。该做法借鉴 Q1 区间投影形式,但因没有真实时长,不是《E题V2》式 (4.34) 的物理时间实现。下列指标只能作为索引进程近似对齐后可供 Q2 训练的证据,不能作为真实时间对齐精度。

输入审计发现,官方 vision_lengths 之后仍有非零视觉行的样本在 train/valid/test 分别为 618/141/131 条;适配器保留这些已知观测并标记长度冲突及尾部歧义。text 在 text_bert 注意力掩码外仍有非零填充行,三划分分别为 86078/17772/18041 行;适配时均排除。没有逐行质量字段,可见行只使用 q*=1, J_Q=0 回退,不制造质量分数。官方划分分别为 3395/728/727 条,来源视频组两两无交集。

将既有正式 aligned 实验选定的 C5 结构预先固定,在未对齐版 train 上从头拟合 8 轮结构化补全器和 C5(第 11 轮早停,保留第 8 轮权重),在独立训练视频组上选择可靠度并校准温度。未对齐版没有重新进行 C0–C7 结构选择,结果与 aligned 正式结果仅作描述性对照:

特征版本与评估集 Accuracy Macro-F1 MAE Pearson 90% 区间覆盖率
aligned 验证 0.6168 0.5472 0.6615 0.6176 0.8929
未对齐索引投影 验证 0.6099 0.5253 0.6701 0.6159 0.9011
aligned 测试 0.6740 0.5861 0.6980 0.6300 0.8968
未对齐索引投影 测试 0.6726 0.5668 0.7059 0.6385 0.9010

未对齐测试集的 Accuracy 为 489/727;Macro-F1 低于 aligned 版约 0.0193,MAE 高约 0.0079。这些差异同时包含原生特征组织、近似投影与训练随机性的影响,不能单独解释为对齐算法优劣。未对齐版测试的 300 次来源视频组 Bootstrap 95% 区间为:Accuracy [0.6328, 0.7124]、Macro-F1 [0.5289, 0.6050]、MAE [0.6558, 0.7572]。C5 的最终温度为 1.0310,内层选择的可靠度候选为 (rho_imp=0.5, lambda_u=0, lambda_gap=0, lambda_span=0);完整指标、视频组区间、测试预测及运行清单见 Q2/results_unaligned。

附件三未对齐版只有 raw_text、audio 和 vision,缺少可直接给学生模型的文本数值特征及可信的音视频长度字段。按《E题V2》2.2 和 5.1.1 的接口规则,不能用原文绕过专项缺失,也不能从零尾段臆断真实长度;本轮不输出附件三未对齐版预测。取得可信长度与不泄漏缺失状态的文本数值字段后,才可按同一接口开展该专项推理。

主要结果文件

  • Q1 五折模型对照:Q1/results/model_comparison_v2/comparison_summary.csv、fold_metrics.csv、oof_predictions.csv、group_bootstrap_deltas.csv。
  • Q1 特征文件与样本清单:Q1/features_v2/。
  • Q1 随机样本词到原始音频/视频位置图:Q1/results/alignment_query_example.png;重绘脚本为 Q1/visualize_alignment.py。
  • Q2 验证消融与正式指标:Q2/results/ablation_validation.csv、validation_metrics.json、test_metrics.json。
  • Q2 缺失控制与组区间:Q2/results/controlled_missingness.csv、controlled_group_bootstrap.csv、group_bootstrap_ci.csv。
  • Q2 匹配缺失类型及图表:Q2/results/matched_missing_type.csv、matched_missing_type_audit.csv、matched_missing_type_bootstrap.csv、matched_missing_type_manifest.json、aligned_missingness_effects.png;脚本见 Q2/run_matched_missing_type.py 和 Q2/plot_missingness_effects.py。
  • Q2 附件三输出:Q2/results/attachment3_predictions.csv、attachment3_audit.csv。
  • Q1 未对齐索引适配:Q1/unaligned_adapter.py、Q1/UNALIGNED_ADAPTER.md;Q2 未对齐 C5 训练与结果:Q2/train_unaligned_c5.py、Q2/results_unaligned/。