Files

4.6 KiB
Raw Permalink Blame History

E 题 V2:Q1/Q2 算法与结果复核

复核日期:2026-09-25。范围仅包括 math/。

Q1 五折探针与 Accuracy

Q1 使用 100 个特征样本,按 video_id 做五折 GroupKFold;缩放器在每折训练部分拟合,表中为每个样本恰好一次的 out-of-fold(OOF)预测。

Accuracy 是三类情感极性分类的正确率,类别由情感值符号确定:负值为 negative、零值为 neutral、正值为 positive。它不是词/时间边界准确率;数据没有人工对齐边界真值,因此没有报告边界准确率。此前回复漏列了 Accuracy,但 comparison_summary.csv 和本目录报告一直都包含该项。

分支 OOF Accuracy OOF Macro-F1 OOF MAE
B0 0.5900 0.3373 0.5345
B1 0.5700 0.3084 0.5342
B2 0.5500 0.2769 0.5308
B3 0.5700 0.3084 0.5202
B4 0.6000 0.3882 0.5393

Q2 V2 实现核查

  • 使用附件二官方 train/valid/test 拆分;样本数分别为 3395/728/727,来源 video_id 组数为 1528/239/381,官方拆分间重叠为 0。训练拟合、可靠度选择和温度校准也在训练集内按视频组互斥。
  • 结构化高斯补全器按 8 维共享状态、每模态 4 维私有状态构建;训练只拟合训练子集的标准化器和观测高斯边际似然,补全器在教师/学生训练前冻结。观测行在后验采样中保持原样。
  • 输入没有逐行质量分数/质量可用标记,因此按论文回退规则处理:可见行 q*=1, J_Q=0,即 R_eff=R。质量到噪声映射在这份输入中不可识别,没有伪造该消融。
  • 缺失训练覆盖 0/0.1/0.3/0.5/0.7,包含单模态、同步、部分重叠和异步连续片段,并保留被遮蔽模态至少 20% 的原始观测。验证控制掩码预先固定;等权 T/A/V 统计自然、附加和最终缺失率。
  • 执行 C0–C7 结构消融,以及无距离/跨度惩罚、无辅助重构、点掩码三个独立诊断。C7 蒸馏与平滑组风险分开;组风险在训练组内固定留出上联合选择,最终选出的候选为 λ_G=0.10, τ=0.05。
  • 训练阶段使用 4 条联合轨迹,评估/推理使用 16 条;极性概率与正负 Beta 幅度先混合,再做温度校准。neutral 具有精确零点质量,预测并列优先 neutral。
  • 全量正式运行使用 12 轮上限、补全器 8 轮、batch 64、patience 3、种子 20260924、RTX 5070 Ti;官方验证选择 C5,温度为 1.2127。最终测试集只评估一次,不用于调参。
  • 已完成 42 个缺失控制情景;控制审计 30,576 行,模型情景指标 504 行,1000 次来源视频组配对 Bootstrap 结果 2,568 行,测试门控逐样本/步/模态诊断 109,050 行。
  • 附件三产生 30 条无标签预测,并验证唯一 ID、情感符号与类别一致、概率和为 1、分值范围与区间合法。附件三没有标签,不报告 Accuracy/F1。

Q2 正式结果

指标 官方验证集 官方测试集
Accuracy 0.6168 0.6740
Macro-F1 0.5472 0.5861
MAE 0.6615 0.6980
RMSE 0.8930 0.9674
Pearson 0.6176 0.6300
90% 区间覆盖率 0.8929 0.8968
90% 区间平均宽度 2.3819 2.4824

测试集分类支持数为 negative 207、neutral 158、positive 362。指标和按来源视频组的置信区间见 results/test_metrics.json 与 results/group_bootstrap_ci.csv;缺失鲁棒性曲线及区间见 results/controlled_missingness.csv、results/controlled_group_bootstrap.csv。

遮挡模式 C5 AURC-MAE 相对 C0 差值 95% 视频组 Bootstrap 区间
单模态 0.6696 -0.0758 [-0.1118, -0.0389]
同步 0.6890 -0.0758 [-0.1105, -0.0417]
部分重叠 0.6883 -0.0774 [-0.1146, -0.0429]
异步 0.6880 -0.0894 [-0.1261, -0.0554]

产物与已修复问题

results/ablation_validation.csv 含 C0–C7 和三项诊断,共 12 个模型行;诊断图为 q2_diagnostics.png 与 q2_gate_positions.png。正式训练已完成模型比较、测试预测、逐场景评估和组 Bootstrap。

首次附件三导出暴露 Beta 参数索引少一维的问题。已修复为分别读取路径、样本、极性、Beta 参数四个轴,并通过独立脚本从已保存检查点重新生成 30 条预测及审计。结果清单同步为本次 12/8 轮正式运行参数。predict_attachment3.py 可安全重复执行并从当前验证/测试结果更新清单。

仍无法用现有数据验证人工对齐边界误差、逐行质量映射效果、否定/转折语义边界效果或附件三预测准确率;这些数据标签/字段并不存在。