Files

159 lines
14 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Q1/Q2/Q3 实验结果与复现摘要
本报告汇总 `final/` 内可复核的 Q1 物理时间对齐结果和 Q2 官方未对齐数据比较。模型代码、训练命令、数据目录和依赖说明见 [README.md](README.md)。数值结果链接均指向本项目内的 CSV、JSON 或实验审计文件。
## Q1:附件一物理时间特征
Q1 包含 100 条视频片段、37 个来源视频组。文本使用 BERT/CTC 词区间,音频为 74 维,视觉为 OpenFace 35 维;五折按 `video_id` 分组。表内分类指标表示情感探针表现,不是边界准确率。
| 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF Pearson |
|---|---:|---:|---:|---:|
| B0 | 0.5900 | 0.3373 | 0.5345 | 0.4255 |
| B1 | 0.5700 | 0.3084 | 0.5342 | 0.3981 |
| B2 | 0.5500 | 0.2769 | 0.5308 | 0.4232 |
| B3 | 0.5700 | 0.3084 | 0.5202 | 0.4114 |
| B4 | 0.6000 | 0.3882 | 0.5393 | 0.3413 |
特征包保留每条样本的模态掩码、物理时间区间、来源哈希和配置哈希。96 条样本状态为 success,4 条为 partial;部分样本因 OpenFace 有效性门控未通过而保留视觉缺失状态。[Q1 完整 OOF 表](output/q1/model_comparison/comparison_summary.csv) · [100 样本特征清单](output/q1/features_v2/manifest_q1.jsonl) · [包体审计](output/q1/package_audit.json)
Q1 adapter 使用带媒体时戳的原生特征进行物理时间聚合;Q2 未对齐特征只可按归一化进程投影,两个坐标语义不混用。
## Q2:附件二未对齐输入的全模型比较
### 统一 adapter:附件二未对齐数据全模型比较(本轮)
本轮用题目附件二 unaligned_50.pkl 作为 Q2 输入,并由 [统一 adapter](adapter/) 的 adapt_official_split 接口统一投影。源文件 SHA-256 为 77eda14a06be9749a96c52ae45470c7cffcfa7219011eae391d231a0664c3762。比较覆盖数学分支 C0–C7 与三项 C6 单因素诊断,以及保留的 EarlyConcat + BiGRU、MoFE-7 + MLP Router;共 14 个模型版本。运行 seed 为 20260924;神经模型使用 batch size 128,C0 线性基线按各自实现训练。
附件二官方 train/valid/test 分别为 3,395/728/727 条,来源视频组数为 1,528/239/381,官方划分的视频组互不重叠。文本、音频、视觉原始特征形状分别为 (N,50,768)、(N,500,74)、(N,500,35),适配器按归一化相对进程将各模态投影至 50 个目标位置。这是相对进程投影,不代表真实秒级时间同步。适配器排除了注意力掩码外的非零文本填充行;train/valid/test 的此类行数为 86,078/17,772/18,041。视觉长度冲突样本数为 618/141/131;数据没有可信的词/帧时间戳和逐行质量字段。
两条训练路线使用相同官方数据和 adapter 输出,但各自保留预处理、训练损失及检查点选择流程,因此跨分支差异不能单独解释为融合架构的因果效果。数学分支再从 train 内部划分可靠性选择与温度校准组;深度学习分支以官方 valid 的固定遮蔽情景选择轮次。验证集用于所有模型比较;正式测试只运行内部留组选择出的数学 C6 和两种指定深度学习方案,不用测试集挑选 12 个数学变体中的赢家。
#### 官方验证集自然缺失表现
下表为 728 条官方验证样本的自然缺失条件指标。CSV 保留完整精度。
| 模型 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ |
|---|---:|---:|---:|---:|---:|
| C0 | 0.5907 | 0.5573 | 0.7268 | 0.9494 | 0.5186 |
| C1 | 0.5879 | 0.4739 | 0.7446 | 0.9823 | 0.5362 |
| C2 | 0.5962 | 0.4503 | 0.6982 | 0.9260 | 0.5808 |
| C3 | 0.5907 | 0.4433 | 0.7318 | 0.9857 | 0.5457 |
| C4 | 0.5549 | 0.4536 | 0.7454 | 1.0156 | 0.5033 |
| C5 | 0.5824 | 0.4401 | 0.7788 | 1.0248 | 0.5123 |
| C6 | 0.6085 | 0.5188 | 0.6847 | 0.9208 | **0.6102** |
| C6 去距离/跨度惩罚 | 0.6071 | 0.4721 | 0.7118 | 0.9323 | 0.6075 |
| C6 去辅助重构 | 0.5838 | 0.4833 | 0.7092 | 0.9543 | 0.5635 |
| C6 点遮蔽 | 0.5810 | 0.5026 | 0.6792 | 0.9176 | 0.5959 |
| C7 蒸馏 | 0.5920 | 0.4871 | 0.7025 | 0.9442 | 0.5753 |
| C7 分组风险 | 0.6003 | 0.4509 | 0.7323 | 0.9356 | 0.6008 |
| EarlyConcat + BiGRU | **0.6236** | **0.5779** | 0.6614 | 0.8731 | 0.6092 |
| MoFE-7 + MLP Router | 0.6140 | 0.5661 | **0.6426** | **0.8499** | 0.6014 |
自然缺失验证集上,EarlyConcat 的 Accuracy 和 Macro-F1 点估计最高,MoFE 的 MAE/RMSE 最低;C6 的 Pearson 在 14 个版本中最高。数学分支内部,C0 的 Macro-F1 最高,C6 的 Accuracy/Pearson 最高,C6 点遮蔽的 MAE/RMSE 最低。以上为单种子点估计,不据此声称统计显著。
#### 官方测试集结果
| 模型 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ |
|---|---:|---:|---:|---:|---:|
| C6(数学分支内部选择) | **0.6726** | 0.5485 | 0.7100 | 0.9693 | 0.6424 |
| EarlyConcat + BiGRU | 0.6699 | 0.5870 | 0.6851 | 0.9017 | **0.6613** |
| MoFE-7 + MLP Router | 0.6630 | **0.5879** | **0.6702** | **0.8895** | 0.6447 |
数学 C6 在 727 条测试样本上的 300 次来源视频组 Bootstrap 95% 区间为 Accuracy [0.6337, 0.7084]、Macro-F1 [0.5108, 0.5872]、MAE [0.6579, 0.7620]、RMSE [0.8732, 1.0580]、Pearson [0.5640, 0.7087]。EarlyConcat 与 MoFE 的 1,000 次配对来源视频组 Bootstrap 比较如下,差值定义为 MoFE − EarlyConcat:
| 指标 | 差值 | 95% Bootstrap 区间 |
|---|---:|---:|
| Accuracy | -0.0069 | [-0.0303, 0.0147] |
| Macro-F1 | +0.0009 | [-0.0312, 0.0295] |
| MAE | -0.0148 | [-0.0429, 0.0136] |
| RMSE | -0.0121 | [-0.0448, 0.0191] |
| Pearson | -0.0166 | [-0.0384, 0.0053] |
这五个区间均跨零。Bootstrap 以来源视频组重采样,表示当前测试组上的抽样不确定性;本轮只有一个训练 seed,不能表示不同随机种子间的波动。
#### 连续缺失曲线表现
两条流水线均在官方验证集上评估 42 个固定遮蔽情景。下表把单模态、同步、部分重叠和异步四类 0%/10%/30%/50%/70% 遮蔽曲线压缩为归一化梯形 MAE 面积(AURC-MAE),按实际新增缺失率积分,越低越好。表中为点估计;各方案的训练目标与预处理仍有差别。
| 模型 | 单模态 | 同步 | 部分重叠 | 异步 |
|---|---:|---:|---:|---:|
| C0 | 0.7425 | 0.7643 | 0.7578 | 0.7696 |
| C1 | 0.7431 | 0.7849 | 0.7343 | 0.7406 |
| C2 | 0.7279 | 0.7444 | 0.7409 | 0.7512 |
| C3 | 0.7449 | 0.7573 | 0.7562 | 0.7577 |
| C4 | 0.7544 | 0.7610 | 0.7660 | 0.7770 |
| C5 | 0.7921 | 0.8176 | 0.8084 | 0.8118 |
| C6 | 0.7028 | 0.7237 | 0.7292 | 0.7283 |
| C6 去距离/跨度惩罚 | 0.7242 | 0.7387 | 0.7366 | 0.7333 |
| C6 去辅助重构 | 0.7128 | 0.7382 | 0.7271 | 0.7429 |
| C6 点遮蔽 | 0.6824 | 0.6988 | 0.6866 | 0.6951 |
| C7 蒸馏 | 0.7215 | 0.7468 | 0.7420 | 0.7359 |
| C7 分组风险 | 0.7437 | 0.7452 | 0.7453 | 0.7501 |
| EarlyConcat + BiGRU | 0.6613 | 0.6579 | 0.6493 | 0.6551 |
| MoFE-7 + MLP Router | **0.6509** | **0.6472** | **0.6417** | **0.6525** |
在两种深度学习方案之间,MoFE − EarlyConcat 的 AURC-MAE 配对 95% 区间分别为:单模态 -0.0104 [-0.0347, 0.0111]、同步 -0.0107 [-0.0322, 0.0093]、部分重叠 -0.0075 [-0.0280, 0.0112]、异步 -0.0026 [-0.0219, 0.0149];均跨零。数学分支 C6 的四种 AURC 点估计均低于 C0,但这是描述性点差;不把它解读为跨随机种子的稳健优势。
完整精度及审计文件:[14 个版本验证指标](output/q2/comparison_validation.csv) · [3 个正式测试结果](output/q2/comparison_test.csv) · [全部版本 AURC-MAE](output/q2/comparison_aurc.csv) · [数学运行清单](experiments/q2/unaligned_math_all_b128/run_manifest.json) · [深度学习运行清单](experiments/q2/unaligned_deep_two_b128/run_manifest.json) · [数学 42 情景明细(gzip CSV)](experiments/q2/unaligned_math_all_b128/controlled_missingness.csv.gz) · [深度学习 42 情景明细](experiments/q2/unaligned_deep_two_b128/controlled_metrics_by_scenario.csv) · [深度学习测试配对 Bootstrap](experiments/q2/unaligned_deep_two_b128/official_test_paired_bootstrap.csv)。
## Q3:ATI–HO 锚定交互与分层 Owen 归因
本轮按用户更正后的 ATI–HO 方案完成 Q3 训练与评估。输入使用官方 `unaligned_50.pkl`,经统一 Q1 adapter 转成 50 个 Relative-Progress 槽,复用仅由训练集拟合的 Q2 robust scaler。训练/验证/测试为 3,395/728/727 条,来源视频组为 1,528/239/381,组间无重叠。相对进度统一序列顺序,不代表物理时间同步。
### 训练与选型
Stage I 用 seed 42 训练 A0/A1/A2/A3 和未锚定诊断 D0;Stage II 对 EarlyConcat + BiGRU、MoFE-7 + MLP Router、Stage I 初选方案及两项关键消融使用 seeds 42、3407、2026。按锁定验证集四个固定遮蔽场景任务损失的三 seed 均值选择最终模型。Stage I 初选 A2;Stage II 三 seed 选出 **A0(仅锚定主效应)**:
| ATI 方案 | 固定场景验证损失(均值 ± 标准差) |
|---|---:|
| A0 | **0.86580 ± 0.00920** |
| A1(秩 4 pairwise) | 0.86728 ± 0.01282 |
| A2(锚定交叉注意力) | 0.86859 ± 0.01014 |
结果不支持在最终模型中保留更复杂的 pairwise 分支;A1/A2 仍作为消融完整留档。附件 4 标签未参与训练、选型和结果计算。
### 官方验证集性能
表中数值为三 seed 均值 ± 标准差;分类保留 negative/neutral/positive 三类。
| 模型 | Seeds | Accuracy ↑ | Macro-F1 ↑ | 强度 MAE ↓ | Pearson ↑ |
|---|---:|---:|---:|---:|---:|
| EarlyConcat + BiGRU | 3 | 0.632 ± 0.010 | 0.594 ± 0.018 | **0.629 ± 0.008** | **0.621 ± 0.003** |
| MoFE-7 + MLP Router | 3 | 0.624 ± 0.010 | **0.598 ± 0.009** | 0.639 ± 0.004 | 0.614 ± 0.004 |
| ATI–HO A0 | 3 | **0.633 ± 0.002** | 0.593 ± 0.010 | 0.740 ± 0.015 | 0.565 ± 0.003 |
A0 的 Accuracy 点估计略高,但 Macro-F1 接近两条基线,强度 MAE 和 Pearson 明显较弱。因此“最终选中”只表示它在预先规定的组合验证损失上均值最低,不表示它在所有指标上优于基线。
按验证视频组进行 1,000 次配对 Bootstrap。正值表示 ATI–HO 更好;MAE 差值定义为“基线 MAE − ATI–HO MAE”。所有区间均为 95%:
| 对比 | 指标 | 差值 | Bootstrap 区间 |
|---|---|---:|---:|
| A0 − EarlyConcat | Accuracy | +0.0027 | [-0.0157, 0.0218] |
| A0 − EarlyConcat | Macro-F1 | +0.0044 | [-0.0192, 0.0287] |
| EarlyConcat MAE − A0 MAE | MAE | -0.1211 | [-0.1553, -0.0892] |
| A0 − EarlyConcat | Pearson | -0.0619 | [-0.0922, -0.0338] |
| A0 − MoFE | Accuracy | +0.0000 | [-0.0177, 0.0182] |
| A0 − MoFE | Macro-F1 | -0.0118 | [-0.0329, 0.0079] |
| MoFE MAE − A0 MAE | MAE | -0.1158 | [-0.1488, -0.0835] |
| A0 − MoFE | Pearson | -0.0571 | [-0.0863, -0.0268] |
分类差异区间跨零;连续强度指标显示 A0 在当前验证组上弱于两条基线。Bootstrap 描述固定训练检查点在验证视频组上的抽样不确定性,不代表训练 seed 不确定性。
### 结构与解释审计
ATI 参数向量为三个居中类别 logit 与负/正条件强度参数;A0 的输出按锚定主效应加和重构,训练后最大重构残差为 0。A0–A3 的锚定结构检查通过;D0 未锚定诊断用于检查缺失模态基线泄漏。
最终 A0 在 728 条验证样本上的解析分类 Shapley 与 8 个模态联盟精确枚举通过率为 100%,最大绝对误差 6.81×10⁻⁷(容差 1e-6 绝对误差加 1e-5 相对误差)。Attachment 4 的 20 个无标签样本通过率也为 100%。类别选择和 sigmoid 解码后的强度输出为非线性量,因此强度贡献直接用 8 联盟精确枚举,没有套用参数线性分解。
Attachment 4 的 Hierarchical Owen 归因按三模态外层分组、每模态 10 个相对进度片段内层分组,从 8 次随机排列开始并依据稳定性增加至最多 64 次。20 个样本的最大守恒残差为 4.41×10⁻⁶。删除/保留诊断采用 10%/20%/30% 预算,并以同模态、同片段数随机选择作对照;这些数值是模型遮挡响应,不是人工解释准确率或因果效应。训练 seed 与 1% 输入扰动稳定性分别记录在 [稳定性审计表](experiments/q3/ati_ho/results/ati_ho/stability_results.csv)。
本轮 14/20 个附件 4 样本在最多 64 次排列内满足 Owen 停止条件,平均 45.6 次。30% 删除时,ATI–HO 选中的局部片段使固定 logit margin 平均下降 0.433;同模态、同片段数随机片段下降 0.112。训练 seed 归因的平均相关为 0.252、top-5 Jaccard 为 0.380,说明细粒度位置排序存在 seed 波动;1% 输入扰动下的五个诊断样本保持了相同 top-5 证据。A0 每 seed 有 127,020 个可训练参数,三 seed 集成单样本推理约 4.842 ms;8 联盟 Shapley 约 0.044 秒/样本,Owen 约 0.131 秒/样本(RTX 5070 Ti)。这些时间只表示本轮运行环境。
### 题目输出和完整材料
题目输出目录 `output/q3/ati_ho/` 仅放附件 4 的预测与解释交付件:`attachment4_predictions.csv`(20 行类别、强度及概率)、`attachment4_explanations.csv`(参数分解及 Shapley)、`attachment4_local_evidence.csv`(Owen 片段贡献)、`attachment4_prediction_manifest.json`(输入/模型哈希和审计范围)。附件 4 没有标签,不报告其准确率或误差。
工作区 `experiments/q3/ati_ho/` 保留完整候选与基线权重,以及逐 seed 指标、验证集 Shapley、Bootstrap、结构、Owen、fidelity、稳定性和复杂度结果。精简提交包包含最终 A0 三 seed 权重和完整结果表。主要文档:[实验结果](experiments/q3/ati_ho/results/ati_ho/ATI_HO_RESULTS.md) · [论文式报告](experiments/q3/ati_ho/results/ati_ho/ATI_HO_PAPER.md) · [验收摘要](experiments/q3/ati_ho/results/ati_ho/EXECUTIVE_SUMMARY.md) · [运行清单](experiments/q3/ati_ho/results/ati_ho/run_manifest.json) · [三 seed 指标表](experiments/q3/ati_ho/results/ati_ho/main_results.csv) · [视频组 Bootstrap](experiments/q3/ati_ho/results/ati_ho/bootstrap_results.csv) · [Owen 与 fidelity 明细](experiments/q3/ati_ho/results/ati_ho/owen_audit.csv) · [稳定性审计](experiments/q3/ati_ho/results/ati_ho/stability_results.csv) · [附件 4 预测](output/q3/ati_ho/attachment4_predictions.csv) · [附件 4 局部证据](output/q3/ati_ho/attachment4_local_evidence.csv)。
模型定义在 `model/ati_ho.py` 与 `model/ati_ho_config.py`,训练和评估命令见 [Q3 运行说明](q3/ati_ho/README.md)。此前 MoFE 第一轮解释与 Router 热力图已从题目输出目录移入工作区历史记录;当前 Q3 结果以 ATI–HO 为准。