Files
modeling_zhaocui/math/E题V2_Q1_Q2模型结果汇总.md
T

5.6 KiB
Raw Blame History

E 题 V2:Q1 / Q2 模型与实验结果汇总

本文件汇总 E题V2.pdf 对应的 Q1、Q2 实现和正式实验结果。Q1 的算法复核见 Q1/V2_REVIEW.md,Q2 的算法复核见 Q2/V2_REVIEW.md。

Q1:模态对齐与分支探针

Q1 为 100 个样本构建 0.1 秒物理时间主网格,保留真实末段长度、逐维掩码和覆盖率;文本使用冻结 BERT 特征与 CTC 硬/后验对齐,音频提取 74 维特征,视觉使用 OpenFace 2.2.0 的 35 维特征。主特征包含 100 个样本、300 条模态明细,总计 44,321,715 字节。数据结构与读取接口见 Q1/README.md。

对 B0–B4 使用按 video_id 分组的五折 GroupKFold;100 个样本分属 37 个来源视频组,缩放器只在每折训练组上拟合。表中 Accuracy 和 Macro-F1 是按情感极性(负向、零值/中性、正向)分类的 OOF 指标,不是对齐边界准确率。

分支 OOF Accuracy OOF Macro-F1 OOF MAE OOF RMSE OOF Pearson
B0 0.5900 0.3373 0.5345 0.7325 0.4255
B1 0.5700 0.3084 0.5342 0.7444 0.3981
B2 0.5500 0.2769 0.5308 0.7342 0.4232
B3 0.5700 0.3084 0.5202 0.7371 0.4114
B4 0.6000 0.3882 0.5393 0.7628 0.3413

B4 的 Accuracy 与 Macro-F1 最高;B3 的 MAE 最低。分类与回归没有由同一分支同时取得最好结果。没有人工词边界真值,因此不报告边界误差或 CTC 后验经验校准率。完整折外预测、分折指标、Bootstrap 差值与运行参数见 Q1/results/model_comparison_v2。

Q2:缺失鲁棒情感模型

Q2 使用附件二官方划分:训练集 3,395 条 / 1,528 个来源视频组,验证集 728 条 / 239 组,测试集 727 条 / 381 组;三份官方集合的来源视频组两两不重叠。结构化共享/私有状态空间补全器为 8 维共享状态加每模态 4 维私有状态;训练遮蔽率为 0、0.1、0.3、0.5、0.7,并比较 C0–C7 结构和三个单因素诊断。测试集仅用于最终一次评估。

验证集模型对照

下表为 ablation_validation.csv 中的 728 条验证样本结果。所有指标按原文件保留并四舍五入到 4 位小数;C0 是 Logistic/Ridge 基线,后续为结构消融及单因素诊断。

模型 Accuracy Macro-F1 MAE RMSE Pearson
C0 0.5920 0.5559 0.7334 0.9372 0.5192
C1 0.6071 0.5512 0.6780 0.9222 0.5780
C2 0.5975 0.4764 0.7159 0.9473 0.5797
C3 0.6085 0.4974 0.7171 0.9520 0.5966
C4 0.6085 0.5551 0.6918 0.9516 0.5685
C5(最终选定) 0.6154 0.5446 0.6624 0.8933 0.6174
C6 0.6264 0.5801 0.6457 0.8814 0.6157
C6 无距离/跨度惩罚 0.6044 0.5145 0.6795 0.9098 0.6046
C6 无辅助重构 0.6003 0.5178 0.6957 0.9327 0.5887
C6 点遮蔽 0.6030 0.5513 0.6945 0.9554 0.5647
C7 仅蒸馏 0.5907 0.5244 0.6743 0.8981 0.6013
C7 仅组风险 0.6085 0.5117 0.6860 0.9253 0.5912

C6 在这组验证点指标中取得较高的 Accuracy、Macro-F1、MAE 和 RMSE;正式选择仍按论文实验流程中的验证选择损失执行,最终选择 C5。ablation_validation.csv 中 C5 的消融指标与正式导出的 validation_metrics.json 有小幅差异,下面正式验证结果按 JSON 原值报告;没有将两份文件的数值混合。

C5 正式验证与测试结果

指标 官方验证集 官方测试集
Accuracy 0.6168 0.6740
Macro-F1 0.5472 0.5861
MAE 0.6615 0.6980
RMSE 0.8930 0.9674
Pearson 0.6176 0.6300
Brier 0.4918 0.4409
分类 NLL 0.8373 0.7614
ECE(15 桶) 0.0597 0.0499
90% 预测区间覆盖率 0.8929 0.8968
90% 预测区间平均宽度 2.3819 2.4824

测试集类别支持数为负向 207、中性 158、正向 362;相应召回率为 0.7440、0.2089、0.8370。温度校准参数为 1.2127。测试集指标、预测、组 Bootstrap 区间及门控诊断见 Q2/results。

连续缺失控制

验证集共执行 42 个固定缺失情景。C5 的归一化 AURC-MAE 及相对 C0 的差值如下;差值置信区间由来源视频组配对 Bootstrap 得到。

遮蔽模式 C5 AURC-MAE 相对 C0 差值 95% Bootstrap 区间
单模态 0.6696 -0.0758 [-0.1118, -0.0389]
同步 0.6890 -0.0758 [-0.1105, -0.0417]
部分重叠 0.6883 -0.0774 [-0.1146, -0.0429]
异步 0.6880 -0.0894 [-0.1261, -0.0554]

附件三有 30 条无标签样本,仅导出预测和审计,不计算 Accuracy 或 F1。aligned_50.pkl 没有逐行质量分数,因此按算法回退规则对可见行取 q*=1, J_Q=0;无人工边界或附件三标签的项目不报告虚构的监督指标。

主要结果文件

  • Q1 五折模型对照:Q1/results/model_comparison_v2/comparison_summary.csv、fold_metrics.csv、oof_predictions.csv、group_bootstrap_deltas.csv。
  • Q1 特征文件与样本清单:Q1/features_v2/。
  • Q1 随机样本词到原始音频/视频位置图:Q1/results/alignment_query_random_seed20260925.png;重绘脚本为 Q1/visualize_alignment.py。
  • Q2 验证消融与正式指标:Q2/results/ablation_validation.csv、validation_metrics.json、test_metrics.json。
  • Q2 缺失控制与组区间:Q2/results/controlled_missingness.csv、controlled_group_bootstrap.csv、group_bootstrap_ci.csv。
  • Q2 附件三输出:Q2/results/attachment3_predictions.csv、attachment3_audit.csv。