4.6 KiB
E 题 V2:Q1/Q2 算法与结果复核
复核日期:2026-09-25。范围仅包括 math/。
Q1 五折探针与 Accuracy
Q1 使用 100 个特征样本,按 video_id 做五折 GroupKFold;缩放器在每折训练部分拟合,表中为每个样本恰好一次的 out-of-fold(OOF)预测。
Accuracy 是三类情感极性分类的正确率,类别由情感值符号确定:负值为 negative、零值为 neutral、正值为 positive。它不是词/时间边界准确率;数据没有人工对齐边界真值,因此没有报告边界准确率。此前回复漏列了 Accuracy,但 comparison_summary.csv 和本目录报告一直都包含该项。
| 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE |
|---|---|---|---|
| B0 | 0.5900 | 0.3373 | 0.5345 |
| B1 | 0.5700 | 0.3084 | 0.5342 |
| B2 | 0.5500 | 0.2769 | 0.5308 |
| B3 | 0.5700 | 0.3084 | 0.5202 |
| B4 | 0.6000 | 0.3882 | 0.5393 |
Q2 V2 实现核查
- 使用附件二官方 train/valid/test 拆分;样本数分别为 3395/728/727,来源
video_id组数为 1528/239/381,官方拆分间重叠为 0。训练拟合、可靠度选择和温度校准也在训练集内按视频组互斥。 - 结构化高斯补全器按 8 维共享状态、每模态 4 维私有状态构建;训练只拟合训练子集的标准化器和观测高斯边际似然,补全器在教师/学生训练前冻结。观测行在后验采样中保持原样。
- 输入没有逐行质量分数/质量可用标记,因此按论文回退规则处理:可见行
q*=1, J_Q=0,即R_eff=R。质量到噪声映射在这份输入中不可识别,没有伪造该消融。 - 缺失训练覆盖 0/0.1/0.3/0.5/0.7,包含单模态、同步、部分重叠和异步连续片段,并保留被遮蔽模态至少 20% 的原始观测。验证控制掩码预先固定;等权 T/A/V 统计自然、附加和最终缺失率。
- 执行 C0–C7 结构消融,以及无距离/跨度惩罚、无辅助重构、点掩码三个独立诊断。C7 蒸馏与平滑组风险分开;组风险在训练组内固定留出上联合选择,最终选出的候选为
λ_G=0.10, τ=0.05。 - 训练阶段使用 4 条联合轨迹,评估/推理使用 16 条;极性概率与正负 Beta 幅度先混合,再做温度校准。neutral 具有精确零点质量,预测并列优先 neutral。
- 全量正式运行使用 12 轮上限、补全器 8 轮、batch 64、patience 3、种子 20260924、RTX 5070 Ti;官方验证选择 C5,温度为 1.2127。最终测试集只评估一次,不用于调参。
- 已完成 42 个缺失控制情景;控制审计 30,576 行,模型情景指标 504 行,1000 次来源视频组配对 Bootstrap 结果 2,568 行,测试门控逐样本/步/模态诊断 109,050 行。
- 附件三产生 30 条无标签预测,并验证唯一 ID、情感符号与类别一致、概率和为 1、分值范围与区间合法。附件三没有标签,不报告 Accuracy/F1。
Q2 正式结果
| 指标 | 官方验证集 | 官方测试集 |
|---|---|---|
| Accuracy | 0.6168 | 0.6740 |
| Macro-F1 | 0.5472 | 0.5861 |
| MAE | 0.6615 | 0.6980 |
| RMSE | 0.8930 | 0.9674 |
| Pearson | 0.6176 | 0.6300 |
| 90% 区间覆盖率 | 0.8929 | 0.8968 |
| 90% 区间平均宽度 | 2.3819 | 2.4824 |
测试集分类支持数为 negative 207、neutral 158、positive 362。指标和按来源视频组的置信区间见 results/test_metrics.json 与 results/group_bootstrap_ci.csv;缺失鲁棒性曲线及区间见 results/controlled_missingness.csv、results/controlled_group_bootstrap.csv。
| 遮挡模式 | C5 AURC-MAE | 相对 C0 差值 | 95% 视频组 Bootstrap 区间 |
|---|---|---|---|
| 单模态 | 0.6696 | -0.0758 | [-0.1118, -0.0389] |
| 同步 | 0.6890 | -0.0758 | [-0.1105, -0.0417] |
| 部分重叠 | 0.6883 | -0.0774 | [-0.1146, -0.0429] |
| 异步 | 0.6880 | -0.0894 | [-0.1261, -0.0554] |
产物与已修复问题
results/ablation_validation.csv 含 C0–C7 和三项诊断,共 12 个模型行;诊断图为 q2_diagnostics.png 与 q2_gate_positions.png。正式训练已完成模型比较、测试预测、逐场景评估和组 Bootstrap。
首次附件三导出暴露 Beta 参数索引少一维的问题。已修复为分别读取路径、样本、极性、Beta 参数四个轴,并通过独立脚本从已保存检查点重新生成 30 条预测及审计。结果清单同步为本次 12/8 轮正式运行参数。predict_attachment3.py 可安全重复执行并从当前验证/测试结果更新清单。
仍无法用现有数据验证人工对齐边界误差、逐行质量映射效果、否定/转折语义边界效果或附件三预测准确率;这些数据标签/字段并不存在。