5.6 KiB
E 题 V2:Q1 / Q2 模型与实验结果汇总
本文件汇总 E题V2.pdf 对应的 Q1、Q2 实现和正式实验结果。Q1 的算法复核见 Q1/V2_REVIEW.md,Q2 的算法复核见 Q2/V2_REVIEW.md。
Q1:模态对齐与分支探针
Q1 为 100 个样本构建 0.1 秒物理时间主网格,保留真实末段长度、逐维掩码和覆盖率;文本使用冻结 BERT 特征与 CTC 硬/后验对齐,音频提取 74 维特征,视觉使用 OpenFace 2.2.0 的 35 维特征。主特征包含 100 个样本、300 条模态明细,总计 44,321,715 字节。数据结构与读取接口见 Q1/README.md。
对 B0–B4 使用按 video_id 分组的五折 GroupKFold;100 个样本分属 37 个来源视频组,缩放器只在每折训练组上拟合。表中 Accuracy 和 Macro-F1 是按情感极性(负向、零值/中性、正向)分类的 OOF 指标,不是对齐边界准确率。
| 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF RMSE | OOF Pearson |
|---|---|---|---|---|---|
| B0 | 0.5900 | 0.3373 | 0.5345 | 0.7325 | 0.4255 |
| B1 | 0.5700 | 0.3084 | 0.5342 | 0.7444 | 0.3981 |
| B2 | 0.5500 | 0.2769 | 0.5308 | 0.7342 | 0.4232 |
| B3 | 0.5700 | 0.3084 | 0.5202 | 0.7371 | 0.4114 |
| B4 | 0.6000 | 0.3882 | 0.5393 | 0.7628 | 0.3413 |
B4 的 Accuracy 与 Macro-F1 最高;B3 的 MAE 最低。分类与回归没有由同一分支同时取得最好结果。没有人工词边界真值,因此不报告边界误差或 CTC 后验经验校准率。完整折外预测、分折指标、Bootstrap 差值与运行参数见 Q1/results/model_comparison_v2。
Q2:缺失鲁棒情感模型
Q2 使用附件二官方划分:训练集 3,395 条 / 1,528 个来源视频组,验证集 728 条 / 239 组,测试集 727 条 / 381 组;三份官方集合的来源视频组两两不重叠。结构化共享/私有状态空间补全器为 8 维共享状态加每模态 4 维私有状态;训练遮蔽率为 0、0.1、0.3、0.5、0.7,并比较 C0–C7 结构和三个单因素诊断。测试集仅用于最终一次评估。
验证集模型对照
下表为 ablation_validation.csv 中的 728 条验证样本结果。所有指标按原文件保留并四舍五入到 4 位小数;C0 是 Logistic/Ridge 基线,后续为结构消融及单因素诊断。
| 模型 | Accuracy | Macro-F1 | MAE | RMSE | Pearson |
|---|---|---|---|---|---|
| C0 | 0.5920 | 0.5559 | 0.7334 | 0.9372 | 0.5192 |
| C1 | 0.6071 | 0.5512 | 0.6780 | 0.9222 | 0.5780 |
| C2 | 0.5975 | 0.4764 | 0.7159 | 0.9473 | 0.5797 |
| C3 | 0.6085 | 0.4974 | 0.7171 | 0.9520 | 0.5966 |
| C4 | 0.6085 | 0.5551 | 0.6918 | 0.9516 | 0.5685 |
| C5(最终选定) | 0.6154 | 0.5446 | 0.6624 | 0.8933 | 0.6174 |
| C6 | 0.6264 | 0.5801 | 0.6457 | 0.8814 | 0.6157 |
| C6 无距离/跨度惩罚 | 0.6044 | 0.5145 | 0.6795 | 0.9098 | 0.6046 |
| C6 无辅助重构 | 0.6003 | 0.5178 | 0.6957 | 0.9327 | 0.5887 |
| C6 点遮蔽 | 0.6030 | 0.5513 | 0.6945 | 0.9554 | 0.5647 |
| C7 仅蒸馏 | 0.5907 | 0.5244 | 0.6743 | 0.8981 | 0.6013 |
| C7 仅组风险 | 0.6085 | 0.5117 | 0.6860 | 0.9253 | 0.5912 |
C6 在这组验证点指标中取得较高的 Accuracy、Macro-F1、MAE 和 RMSE;正式选择仍按论文实验流程中的验证选择损失执行,最终选择 C5。ablation_validation.csv 中 C5 的消融指标与正式导出的 validation_metrics.json 有小幅差异,下面正式验证结果按 JSON 原值报告;没有将两份文件的数值混合。
C5 正式验证与测试结果
| 指标 | 官方验证集 | 官方测试集 |
|---|---|---|
| Accuracy | 0.6168 | 0.6740 |
| Macro-F1 | 0.5472 | 0.5861 |
| MAE | 0.6615 | 0.6980 |
| RMSE | 0.8930 | 0.9674 |
| Pearson | 0.6176 | 0.6300 |
| Brier | 0.4918 | 0.4409 |
| 分类 NLL | 0.8373 | 0.7614 |
| ECE(15 桶) | 0.0597 | 0.0499 |
| 90% 预测区间覆盖率 | 0.8929 | 0.8968 |
| 90% 预测区间平均宽度 | 2.3819 | 2.4824 |
测试集类别支持数为负向 207、中性 158、正向 362;相应召回率为 0.7440、0.2089、0.8370。温度校准参数为 1.2127。测试集指标、预测、组 Bootstrap 区间及门控诊断见 Q2/results。
连续缺失控制
验证集共执行 42 个固定缺失情景。C5 的归一化 AURC-MAE 及相对 C0 的差值如下;差值置信区间由来源视频组配对 Bootstrap 得到。
| 遮蔽模式 | C5 AURC-MAE | 相对 C0 差值 | 95% Bootstrap 区间 |
|---|---|---|---|
| 单模态 | 0.6696 | -0.0758 | [-0.1118, -0.0389] |
| 同步 | 0.6890 | -0.0758 | [-0.1105, -0.0417] |
| 部分重叠 | 0.6883 | -0.0774 | [-0.1146, -0.0429] |
| 异步 | 0.6880 | -0.0894 | [-0.1261, -0.0554] |
附件三有 30 条无标签样本,仅导出预测和审计,不计算 Accuracy 或 F1。aligned_50.pkl 没有逐行质量分数,因此按算法回退规则对可见行取 q*=1, J_Q=0;无人工边界或附件三标签的项目不报告虚构的监督指标。
主要结果文件
- Q1 五折模型对照:
Q1/results/model_comparison_v2/comparison_summary.csv、fold_metrics.csv、oof_predictions.csv、group_bootstrap_deltas.csv。 - Q1 特征文件与样本清单:
Q1/features_v2/。 - Q1 随机样本词到原始音频/视频位置图:
Q1/results/alignment_query_random_seed20260925.png;重绘脚本为Q1/visualize_alignment.py。 - Q2 验证消融与正式指标:
Q2/results/ablation_validation.csv、validation_metrics.json、test_metrics.json。 - Q2 缺失控制与组区间:
Q2/results/controlled_missingness.csv、controlled_group_bootstrap.csv、group_bootstrap_ci.csv。 - Q2 附件三输出:
Q2/results/attachment3_predictions.csv、attachment3_audit.csv。