# E 题 V2:Q1 / Q2 模型与实验结果汇总 本文件汇总 [E题V2.pdf](E题V2.pdf) 对应的 Q1、Q2 实现和正式实验结果。Q1 的算法复核见 [Q1/V2_REVIEW.md](Q1/V2_REVIEW.md),Q2 的算法复核见 [Q2/V2_REVIEW.md](Q2/V2_REVIEW.md)。 ## Q1:模态对齐与分支探针 Q1 为 100 个样本构建 0.1 秒物理时间主网格,保留真实末段长度、逐维掩码和覆盖率;文本使用冻结 BERT 特征与 CTC 硬/后验对齐,音频提取 74 维特征,视觉使用 OpenFace 2.2.0 的 35 维特征。主特征包含 100 个样本、300 条模态明细,总计 44,321,715 字节。数据结构与读取接口见 [Q1/README.md](Q1/README.md)。 对 B0–B4 使用按 `video_id` 分组的五折 GroupKFold;100 个样本分属 37 个来源视频组,缩放器只在每折训练组上拟合。表中 Accuracy 和 Macro-F1 是按情感极性(负向、零值/中性、正向)分类的 OOF 指标,不是对齐边界准确率。 | 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF RMSE | OOF Pearson | |---|---:|---:|---:|---:|---:| | B0 | 0.5900 | 0.3373 | 0.5345 | 0.7325 | 0.4255 | | B1 | 0.5700 | 0.3084 | 0.5342 | 0.7444 | 0.3981 | | B2 | 0.5500 | 0.2769 | 0.5308 | 0.7342 | 0.4232 | | B3 | 0.5700 | 0.3084 | 0.5202 | 0.7371 | 0.4114 | | B4 | 0.6000 | 0.3882 | 0.5393 | 0.7628 | 0.3413 | B4 的 Accuracy 与 Macro-F1 最高;B3 的 MAE 最低。分类与回归没有由同一分支同时取得最好结果。没有人工词边界真值,因此不报告边界误差或 CTC 后验经验校准率。完整折外预测、分折指标、Bootstrap 差值与运行参数见 [Q1/results/model_comparison_v2](Q1/results/model_comparison_v2/)。 ## Q2:缺失鲁棒情感模型 Q2 使用附件二官方划分:训练集 3,395 条 / 1,528 个来源视频组,验证集 728 条 / 239 组,测试集 727 条 / 381 组;三份官方集合的来源视频组两两不重叠。结构化共享/私有状态空间补全器为 8 维共享状态加每模态 4 维私有状态;训练遮蔽率为 0、0.1、0.3、0.5、0.7,并比较 C0–C7 结构和三个单因素诊断。测试集仅用于最终一次评估。 ### 验证集模型对照 下表为 `ablation_validation.csv` 中的 728 条验证样本结果。所有指标按原文件保留并四舍五入到 4 位小数;C0 是 Logistic/Ridge 基线,后续为结构消融及单因素诊断。 | 模型 | Accuracy | Macro-F1 | MAE | RMSE | Pearson | |---|---:|---:|---:|---:|---:| | C0 | 0.5920 | 0.5559 | 0.7334 | 0.9372 | 0.5192 | | C1 | 0.6071 | 0.5512 | 0.6780 | 0.9222 | 0.5780 | | C2 | 0.5975 | 0.4764 | 0.7159 | 0.9473 | 0.5797 | | C3 | 0.6085 | 0.4974 | 0.7171 | 0.9520 | 0.5966 | | C4 | 0.6085 | 0.5551 | 0.6918 | 0.9516 | 0.5685 | | C5(最终选定) | 0.6154 | 0.5446 | 0.6624 | 0.8933 | 0.6174 | | C6 | 0.6264 | 0.5801 | 0.6457 | 0.8814 | 0.6157 | | C6 无距离/跨度惩罚 | 0.6044 | 0.5145 | 0.6795 | 0.9098 | 0.6046 | | C6 无辅助重构 | 0.6003 | 0.5178 | 0.6957 | 0.9327 | 0.5887 | | C6 点遮蔽 | 0.6030 | 0.5513 | 0.6945 | 0.9554 | 0.5647 | | C7 仅蒸馏 | 0.5907 | 0.5244 | 0.6743 | 0.8981 | 0.6013 | | C7 仅组风险 | 0.6085 | 0.5117 | 0.6860 | 0.9253 | 0.5912 | C6 在这组验证点指标中取得较高的 Accuracy、Macro-F1、MAE 和 RMSE;正式选择仍按论文实验流程中的验证选择损失执行,最终选择 C5。`ablation_validation.csv` 中 C5 的消融指标与正式导出的 `validation_metrics.json` 有小幅差异,下面正式验证结果按 JSON 原值报告;没有将两份文件的数值混合。 ### C5 正式验证与测试结果 | 指标 | 官方验证集 | 官方测试集 | |---|---:|---:| | Accuracy | 0.6168 | 0.6740 | | Macro-F1 | 0.5472 | 0.5861 | | MAE | 0.6615 | 0.6980 | | RMSE | 0.8930 | 0.9674 | | Pearson | 0.6176 | 0.6300 | | Brier | 0.4918 | 0.4409 | | 分类 NLL | 0.8373 | 0.7614 | | ECE(15 桶) | 0.0597 | 0.0499 | | 90% 预测区间覆盖率 | 0.8929 | 0.8968 | | 90% 预测区间平均宽度 | 2.3819 | 2.4824 | 测试集类别支持数为负向 207、中性 158、正向 362;相应召回率为 0.7440、0.2089、0.8370。温度校准参数为 1.2127。测试集指标、预测、组 Bootstrap 区间及门控诊断见 [Q2/results](Q2/results/)。 ### 连续缺失控制 验证集共执行 42 个固定缺失情景。C5 的归一化 AURC-MAE 及相对 C0 的差值如下;差值置信区间由来源视频组配对 Bootstrap 得到。 | 遮蔽模式 | C5 AURC-MAE | 相对 C0 差值 | 95% Bootstrap 区间 | |---|---:|---:|---:| | 单模态 | 0.6696 | -0.0758 | [-0.1118, -0.0389] | | 同步 | 0.6890 | -0.0758 | [-0.1105, -0.0417] | | 部分重叠 | 0.6883 | -0.0774 | [-0.1146, -0.0429] | | 异步 | 0.6880 | -0.0894 | [-0.1261, -0.0554] | 附件三有 30 条无标签样本,仅导出预测和审计,不计算 Accuracy 或 F1。`aligned_50.pkl` 没有逐行质量分数,因此按算法回退规则对可见行取 `q*=1, J_Q=0`;无人工边界或附件三标签的项目不报告虚构的监督指标。 ## 主要结果文件 - Q1 五折模型对照:`Q1/results/model_comparison_v2/comparison_summary.csv`、`fold_metrics.csv`、`oof_predictions.csv`、`group_bootstrap_deltas.csv`。 - Q1 特征文件与样本清单:`Q1/features_v2/`。 - Q1 随机样本词到原始音频/视频位置图:`Q1/results/alignment_query_random_seed20260925.png`;重绘脚本为 `Q1/visualize_alignment.py`。 - Q2 验证消融与正式指标:`Q2/results/ablation_validation.csv`、`validation_metrics.json`、`test_metrics.json`。 - Q2 缺失控制与组区间:`Q2/results/controlled_missingness.csv`、`controlled_group_bootstrap.csv`、`group_bootstrap_ci.csv`。 - Q2 附件三输出:`Q2/results/attachment3_predictions.csv`、`attachment3_audit.csv`。