Complete standalone final deliverable and unaligned Q2 results

This commit is contained in:
2026-09-25 22:22:37 +08:00
parent c6b018e5d0
commit adc9c2064b
267 changed files with 15479 additions and 7976 deletions
+20
View File
@@ -146,6 +146,25 @@ C5 的 AURC-MAE 相对 C0 的配对 95% 区间依次为:单模态 [-0.1118, -0
附件三有 30 条无标签样本,仅导出预测和审计,不计算 Accuracy 或 F1。`aligned_50.pkl` 没有逐行质量分数,因此按算法回退规则对可见行取 `q*=1, J_Q=0`;无人工边界或附件三标签的项目不报告虚构的监督指标。
## Q1 对附件二未对齐版的适配与 Q2 探索性训练
`unaligned_50.pkl` 的文本为 `(N,50,768)`,音频为 `(N,500,74)`,视觉为 `(N,500,35)`,但没有媒体时间戳、逐词边界或原始来源帧号。因此不能将 Q1 的 0.1 秒物理对齐主干直接用于这些特征,也不能用相同行号宣称三模态同一时刻。新增的 [适配说明](Q1/UNALIGNED_ADAPTER.md) 和 [接口](Q1/unaligned_adapter.py) 按各模态独立有效长度将索引映射到 `[0,1)`,依据来源与 50 个目标区间的交长汇聚实际观测特征;无观测处保持缺失掩码,保存覆盖率和来源权重。该做法借鉴 Q1 区间投影形式,但因没有真实时长,**不是《E题V2》式 (4.34) 的物理时间实现**。下列指标只能作为索引进程近似对齐后可供 Q2 训练的证据,不能作为真实时间对齐精度。
输入审计发现,官方 `vision_lengths` 之后仍有非零视觉行的样本在 train/valid/test 分别为 618/141/131 条;适配器保留这些已知观测并标记长度冲突及尾部歧义。`text` 在 `text_bert` 注意力掩码外仍有非零填充行,三划分分别为 86078/17772/18041 行;适配时均排除。没有逐行质量字段,可见行只使用 `q*=1, J_Q=0` 回退,不制造质量分数。官方划分分别为 3395/728/727 条,来源视频组两两无交集。
将既有正式 aligned 实验选定的 C5 结构预先固定,在未对齐版 train 上从头拟合 8 轮结构化补全器和 C5(第 11 轮早停,保留第 8 轮权重),在独立训练视频组上选择可靠度并校准温度。未对齐版没有重新进行 C0–C7 结构选择,结果与 aligned 正式结果仅作描述性对照:
| 特征版本与评估集 | Accuracy | Macro-F1 | MAE | Pearson | 90% 区间覆盖率 |
|---|---:|---:|---:|---:|---:|
| aligned 验证 | 0.6168 | 0.5472 | 0.6615 | 0.6176 | 0.8929 |
| 未对齐索引投影 验证 | 0.6099 | 0.5253 | 0.6701 | 0.6159 | 0.9011 |
| aligned 测试 | 0.6740 | 0.5861 | 0.6980 | 0.6300 | 0.8968 |
| 未对齐索引投影 测试 | 0.6726 | 0.5668 | 0.7059 | 0.6385 | 0.9010 |
未对齐测试集的 Accuracy 为 489/727;Macro-F1 低于 aligned 版约 0.0193,MAE 高约 0.0079。这些差异同时包含原生特征组织、近似投影与训练随机性的影响,不能单独解释为对齐算法优劣。未对齐版测试的 300 次来源视频组 Bootstrap 95% 区间为:Accuracy [0.6328, 0.7124]、Macro-F1 [0.5289, 0.6050]、MAE [0.6558, 0.7572]。C5 的最终温度为 1.0310,内层选择的可靠度候选为 `(rho_imp=0.5, lambda_u=0, lambda_gap=0, lambda_span=0)`;完整指标、视频组区间、测试预测及运行清单见 [Q2/results_unaligned](Q2/results_unaligned/)。
附件三未对齐版只有 `raw_text`、`audio` 和 `vision`,缺少可直接给学生模型的文本数值特征及可信的音视频长度字段。按《E题V2》2.2 和 5.1.1 的接口规则,不能用原文绕过专项缺失,也不能从零尾段臆断真实长度;本轮不输出附件三未对齐版预测。取得可信长度与不泄漏缺失状态的文本数值字段后,才可按同一接口开展该专项推理。
## 主要结果文件
- Q1 五折模型对照:`Q1/results/model_comparison_v2/comparison_summary.csv`、`fold_metrics.csv`、`oof_predictions.csv`、`group_bootstrap_deltas.csv`。
@@ -155,3 +174,4 @@ C5 的 AURC-MAE 相对 C0 的配对 95% 区间依次为:单模态 [-0.1118, -0
- Q2 缺失控制与组区间:`Q2/results/controlled_missingness.csv`、`controlled_group_bootstrap.csv`、`group_bootstrap_ci.csv`。
- Q2 匹配缺失类型及图表:`Q2/results/matched_missing_type.csv`、`matched_missing_type_audit.csv`、`matched_missing_type_bootstrap.csv`、`matched_missing_type_manifest.json`、`aligned_missingness_effects.png`;脚本见 `Q2/run_matched_missing_type.py` 和 `Q2/plot_missingness_effects.py`。
- Q2 附件三输出:`Q2/results/attachment3_predictions.csv`、`attachment3_audit.csv`。
- Q1 未对齐索引适配:`Q1/unaligned_adapter.py`、`Q1/UNALIGNED_ADAPTER.md`;Q2 未对齐 C5 训练与结果:`Q2/train_unaligned_c5.py`、`Q2/results_unaligned/`。