Files
modeling_zhaocui/math/E题V2_Q1_Q2模型结果汇总.md
T

84 lines
5.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# E 题 V2:Q1 / Q2 模型与实验结果汇总
本文件汇总 [E题V2.pdf](E题V2.pdf) 对应的 Q1、Q2 实现和正式实验结果。Q1 的算法复核见 [Q1/V2_REVIEW.md](Q1/V2_REVIEW.md),Q2 的算法复核见 [Q2/V2_REVIEW.md](Q2/V2_REVIEW.md)。
## Q1:模态对齐与分支探针
Q1 为 100 个样本构建 0.1 秒物理时间主网格,保留真实末段长度、逐维掩码和覆盖率;文本使用冻结 BERT 特征与 CTC 硬/后验对齐,音频提取 74 维特征,视觉使用 OpenFace 2.2.0 的 35 维特征。主特征包含 100 个样本、300 条模态明细,总计 44,321,715 字节。数据结构与读取接口见 [Q1/README.md](Q1/README.md)。
对 B0–B4 使用按 `video_id` 分组的五折 GroupKFold;100 个样本分属 37 个来源视频组,缩放器只在每折训练组上拟合。表中 Accuracy 和 Macro-F1 是按情感极性(负向、零值/中性、正向)分类的 OOF 指标,不是对齐边界准确率。
| 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF RMSE | OOF Pearson |
|---|---:|---:|---:|---:|---:|
| B0 | 0.5900 | 0.3373 | 0.5345 | 0.7325 | 0.4255 |
| B1 | 0.5700 | 0.3084 | 0.5342 | 0.7444 | 0.3981 |
| B2 | 0.5500 | 0.2769 | 0.5308 | 0.7342 | 0.4232 |
| B3 | 0.5700 | 0.3084 | 0.5202 | 0.7371 | 0.4114 |
| B4 | 0.6000 | 0.3882 | 0.5393 | 0.7628 | 0.3413 |
B4 的 Accuracy 与 Macro-F1 最高;B3 的 MAE 最低。分类与回归没有由同一分支同时取得最好结果。没有人工词边界真值,因此不报告边界误差或 CTC 后验经验校准率。完整折外预测、分折指标、Bootstrap 差值与运行参数见 [Q1/results/model_comparison_v2](Q1/results/model_comparison_v2/)。
## Q2:缺失鲁棒情感模型
Q2 使用附件二官方划分:训练集 3,395 条 / 1,528 个来源视频组,验证集 728 条 / 239 组,测试集 727 条 / 381 组;三份官方集合的来源视频组两两不重叠。结构化共享/私有状态空间补全器为 8 维共享状态加每模态 4 维私有状态;训练遮蔽率为 0、0.1、0.3、0.5、0.7,并比较 C0–C7 结构和三个单因素诊断。测试集仅用于最终一次评估。
### 验证集模型对照
下表为 `ablation_validation.csv` 中的 728 条验证样本结果。所有指标按原文件保留并四舍五入到 4 位小数;C0 是 Logistic/Ridge 基线,后续为结构消融及单因素诊断。
| 模型 | Accuracy | Macro-F1 | MAE | RMSE | Pearson |
|---|---:|---:|---:|---:|---:|
| C0 | 0.5920 | 0.5559 | 0.7334 | 0.9372 | 0.5192 |
| C1 | 0.6071 | 0.5512 | 0.6780 | 0.9222 | 0.5780 |
| C2 | 0.5975 | 0.4764 | 0.7159 | 0.9473 | 0.5797 |
| C3 | 0.6085 | 0.4974 | 0.7171 | 0.9520 | 0.5966 |
| C4 | 0.6085 | 0.5551 | 0.6918 | 0.9516 | 0.5685 |
| C5(最终选定) | 0.6154 | 0.5446 | 0.6624 | 0.8933 | 0.6174 |
| C6 | 0.6264 | 0.5801 | 0.6457 | 0.8814 | 0.6157 |
| C6 无距离/跨度惩罚 | 0.6044 | 0.5145 | 0.6795 | 0.9098 | 0.6046 |
| C6 无辅助重构 | 0.6003 | 0.5178 | 0.6957 | 0.9327 | 0.5887 |
| C6 点遮蔽 | 0.6030 | 0.5513 | 0.6945 | 0.9554 | 0.5647 |
| C7 仅蒸馏 | 0.5907 | 0.5244 | 0.6743 | 0.8981 | 0.6013 |
| C7 仅组风险 | 0.6085 | 0.5117 | 0.6860 | 0.9253 | 0.5912 |
C6 在这组验证点指标中取得较高的 Accuracy、Macro-F1、MAE 和 RMSE;正式选择仍按论文实验流程中的验证选择损失执行,最终选择 C5。`ablation_validation.csv` 中 C5 的消融指标与正式导出的 `validation_metrics.json` 有小幅差异,下面正式验证结果按 JSON 原值报告;没有将两份文件的数值混合。
### C5 正式验证与测试结果
| 指标 | 官方验证集 | 官方测试集 |
|---|---:|---:|
| Accuracy | 0.6168 | 0.6740 |
| Macro-F1 | 0.5472 | 0.5861 |
| MAE | 0.6615 | 0.6980 |
| RMSE | 0.8930 | 0.9674 |
| Pearson | 0.6176 | 0.6300 |
| Brier | 0.4918 | 0.4409 |
| 分类 NLL | 0.8373 | 0.7614 |
| ECE(15 桶) | 0.0597 | 0.0499 |
| 90% 预测区间覆盖率 | 0.8929 | 0.8968 |
| 90% 预测区间平均宽度 | 2.3819 | 2.4824 |
测试集类别支持数为负向 207、中性 158、正向 362;相应召回率为 0.7440、0.2089、0.8370。温度校准参数为 1.2127。测试集指标、预测、组 Bootstrap 区间及门控诊断见 [Q2/results](Q2/results/)。
### 连续缺失控制
验证集共执行 42 个固定缺失情景。C5 的归一化 AURC-MAE 及相对 C0 的差值如下;差值置信区间由来源视频组配对 Bootstrap 得到。
| 遮蔽模式 | C5 AURC-MAE | 相对 C0 差值 | 95% Bootstrap 区间 |
|---|---:|---:|---:|
| 单模态 | 0.6696 | -0.0758 | [-0.1118, -0.0389] |
| 同步 | 0.6890 | -0.0758 | [-0.1105, -0.0417] |
| 部分重叠 | 0.6883 | -0.0774 | [-0.1146, -0.0429] |
| 异步 | 0.6880 | -0.0894 | [-0.1261, -0.0554] |
附件三有 30 条无标签样本,仅导出预测和审计,不计算 Accuracy 或 F1。`aligned_50.pkl` 没有逐行质量分数,因此按算法回退规则对可见行取 `q*=1, J_Q=0`;无人工边界或附件三标签的项目不报告虚构的监督指标。
## 主要结果文件
- Q1 五折模型对照:`Q1/results/model_comparison_v2/comparison_summary.csv`、`fold_metrics.csv`、`oof_predictions.csv`、`group_bootstrap_deltas.csv`。
- Q1 特征文件与样本清单:`Q1/features_v2/`。
- Q1 随机样本词到原始音频/视频位置图:`Q1/results/alignment_query_random_seed20260925.png`;重绘脚本为 `Q1/visualize_alignment.py`。
- Q2 验证消融与正式指标:`Q2/results/ablation_validation.csv`、`validation_metrics.json`、`test_metrics.json`。
- Q2 缺失控制与组区间:`Q2/results/controlled_missingness.csv`、`controlled_group_bootstrap.csv`、`group_bootstrap_ci.csv`。
- Q2 附件三输出:`Q2/results/attachment3_predictions.csv`、`attachment3_audit.csv`。