Files
modeling_zhaocui/math/Q2/V2_REVIEW.md
T

59 lines
4.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# E 题 V2:Q1/Q2 算法与结果复核
复核日期:2026-09-25。范围仅包括 `math/`。
## Q1 五折探针与 Accuracy
Q1 使用 100 个特征样本,按 `video_id` 做五折 `GroupKFold`;缩放器在每折训练部分拟合,表中为每个样本恰好一次的 out-of-fold(OOF)预测。
Accuracy 是三类情感极性分类的正确率,类别由情感值符号确定:负值为 negative、零值为 neutral、正值为 positive。它不是词/时间边界准确率;数据没有人工对齐边界真值,因此没有报告边界准确率。此前回复漏列了 Accuracy,但 `comparison_summary.csv` 和本目录报告一直都包含该项。
| 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE |
|---|---:|---:|---:|
| B0 | 0.5900 | 0.3373 | 0.5345 |
| B1 | 0.5700 | 0.3084 | 0.5342 |
| B2 | 0.5500 | 0.2769 | 0.5308 |
| B3 | 0.5700 | 0.3084 | 0.5202 |
| B4 | 0.6000 | 0.3882 | 0.5393 |
## Q2 V2 实现核查
- 使用附件二官方 train/valid/test 拆分;样本数分别为 3395/728/727,来源 `video_id` 组数为 1528/239/381,官方拆分间重叠为 0。训练拟合、可靠度选择和温度校准也在训练集内按视频组互斥。
- 结构化高斯补全器按 8 维共享状态、每模态 4 维私有状态构建;训练只拟合训练子集的标准化器和观测高斯边际似然,补全器在教师/学生训练前冻结。观测行在后验采样中保持原样。
- 输入没有逐行质量分数/质量可用标记,因此按论文回退规则处理:可见行 `q*=1, J_Q=0`,即 `R_eff=R`。质量到噪声映射在这份输入中不可识别,没有伪造该消融。
- 缺失训练覆盖 0/0.1/0.3/0.5/0.7,包含单模态、同步、部分重叠和异步连续片段,并保留被遮蔽模态至少 20% 的原始观测。验证控制掩码预先固定;等权 T/A/V 统计自然、附加和最终缺失率。
- 执行 C0–C7 结构消融,以及无距离/跨度惩罚、无辅助重构、点掩码三个独立诊断。C7 蒸馏与平滑组风险分开;组风险在训练组内固定留出上联合选择,最终选出的候选为 `λ_G=0.10, τ=0.05`。
- 训练阶段使用 4 条联合轨迹,评估/推理使用 16 条;极性概率与正负 Beta 幅度先混合,再做温度校准。neutral 具有精确零点质量,预测并列优先 neutral。
- 全量正式运行使用 12 轮上限、补全器 8 轮、batch 64、patience 3、种子 20260924、RTX 5070 Ti;官方验证选择 C5,温度为 1.2127。最终测试集只评估一次,不用于调参。
- 已完成 42 个缺失控制情景;控制审计 30,576 行,模型情景指标 504 行,1000 次来源视频组配对 Bootstrap 结果 2,568 行,测试门控逐样本/步/模态诊断 109,050 行。
- 附件三产生 30 条无标签预测,并验证唯一 ID、情感符号与类别一致、概率和为 1、分值范围与区间合法。附件三没有标签,不报告 Accuracy/F1。
## Q2 正式结果
| 指标 | 官方验证集 | 官方测试集 |
|---|---:|---:|
| Accuracy | 0.6168 | 0.6740 |
| Macro-F1 | 0.5472 | 0.5861 |
| MAE | 0.6615 | 0.6980 |
| RMSE | 0.8930 | 0.9674 |
| Pearson | 0.6176 | 0.6300 |
| 90% 区间覆盖率 | 0.8929 | 0.8968 |
| 90% 区间平均宽度 | 2.3819 | 2.4824 |
测试集分类支持数为 negative 207、neutral 158、positive 362。指标和按来源视频组的置信区间见 `results/test_metrics.json` 与 `results/group_bootstrap_ci.csv`;缺失鲁棒性曲线及区间见 `results/controlled_missingness.csv`、`results/controlled_group_bootstrap.csv`。
| 遮挡模式 | C5 AURC-MAE | 相对 C0 差值 | 95% 视频组 Bootstrap 区间 |
|---|---:|---:|---:|
| 单模态 | 0.6696 | -0.0758 | [-0.1118, -0.0389] |
| 同步 | 0.6890 | -0.0758 | [-0.1105, -0.0417] |
| 部分重叠 | 0.6883 | -0.0774 | [-0.1146, -0.0429] |
| 异步 | 0.6880 | -0.0894 | [-0.1261, -0.0554] |
## 产物与已修复问题
`results/ablation_validation.csv` 含 C0–C7 和三项诊断,共 12 个模型行;诊断图为 `q2_diagnostics.png` 与 `q2_gate_positions.png`。正式训练已完成模型比较、测试预测、逐场景评估和组 Bootstrap。
首次附件三导出暴露 Beta 参数索引少一维的问题。已修复为分别读取路径、样本、极性、Beta 参数四个轴,并通过独立脚本从已保存检查点重新生成 30 条预测及审计。结果清单同步为本次 12/8 轮正式运行参数。`predict_attachment3.py` 可安全重复执行并从当前验证/测试结果更新清单。
仍无法用现有数据验证人工对齐边界误差、逐行质量映射效果、否定/转折语义边界效果或附件三预测准确率;这些数据标签/字段并不存在。