159 lines
14 KiB
Markdown
159 lines
14 KiB
Markdown
# Q1/Q2/Q3 实验结果与复现摘要
|
||
|
||
本报告汇总 `final/` 内可复核的 Q1 物理时间对齐结果和 Q2 官方未对齐数据比较。模型代码、训练命令、数据目录和依赖说明见 [README.md](README.md)。数值结果链接均指向本项目内的 CSV、JSON 或实验审计文件。
|
||
|
||
## Q1:附件一物理时间特征
|
||
|
||
Q1 包含 100 条视频片段、37 个来源视频组。文本使用 BERT/CTC 词区间,音频为 74 维,视觉为 OpenFace 35 维;五折按 `video_id` 分组。表内分类指标表示情感探针表现,不是边界准确率。
|
||
|
||
| 分支 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF Pearson |
|
||
|---|---:|---:|---:|---:|
|
||
| B0 | 0.5900 | 0.3373 | 0.5345 | 0.4255 |
|
||
| B1 | 0.5700 | 0.3084 | 0.5342 | 0.3981 |
|
||
| B2 | 0.5500 | 0.2769 | 0.5308 | 0.4232 |
|
||
| B3 | 0.5700 | 0.3084 | 0.5202 | 0.4114 |
|
||
| B4 | 0.6000 | 0.3882 | 0.5393 | 0.3413 |
|
||
|
||
特征包保留每条样本的模态掩码、物理时间区间、来源哈希和配置哈希。96 条样本状态为 success,4 条为 partial;部分样本因 OpenFace 有效性门控未通过而保留视觉缺失状态。[Q1 完整 OOF 表](output/q1/model_comparison/comparison_summary.csv) · [100 样本特征清单](output/q1/features_v2/manifest_q1.jsonl) · [包体审计](output/q1/package_audit.json)
|
||
|
||
Q1 adapter 使用带媒体时戳的原生特征进行物理时间聚合;Q2 未对齐特征只可按归一化进程投影,两个坐标语义不混用。
|
||
|
||
## Q2:附件二未对齐输入的全模型比较
|
||
|
||
### 统一 adapter:附件二未对齐数据全模型比较(本轮)
|
||
|
||
本轮用题目附件二 unaligned_50.pkl 作为 Q2 输入,并由 [统一 adapter](adapter/) 的 adapt_official_split 接口统一投影。源文件 SHA-256 为 77eda14a06be9749a96c52ae45470c7cffcfa7219011eae391d231a0664c3762。比较覆盖数学分支 C0–C7 与三项 C6 单因素诊断,以及保留的 EarlyConcat + BiGRU、MoFE-7 + MLP Router;共 14 个模型版本。运行 seed 为 20260924;神经模型使用 batch size 128,C0 线性基线按各自实现训练。
|
||
|
||
附件二官方 train/valid/test 分别为 3,395/728/727 条,来源视频组数为 1,528/239/381,官方划分的视频组互不重叠。文本、音频、视觉原始特征形状分别为 (N,50,768)、(N,500,74)、(N,500,35),适配器按归一化相对进程将各模态投影至 50 个目标位置。这是相对进程投影,不代表真实秒级时间同步。适配器排除了注意力掩码外的非零文本填充行;train/valid/test 的此类行数为 86,078/17,772/18,041。视觉长度冲突样本数为 618/141/131;数据没有可信的词/帧时间戳和逐行质量字段。
|
||
|
||
两条训练路线使用相同官方数据和 adapter 输出,但各自保留预处理、训练损失及检查点选择流程,因此跨分支差异不能单独解释为融合架构的因果效果。数学分支再从 train 内部划分可靠性选择与温度校准组;深度学习分支以官方 valid 的固定遮蔽情景选择轮次。验证集用于所有模型比较;正式测试只运行内部留组选择出的数学 C6 和两种指定深度学习方案,不用测试集挑选 12 个数学变体中的赢家。
|
||
|
||
#### 官方验证集自然缺失表现
|
||
|
||
下表为 728 条官方验证样本的自然缺失条件指标。CSV 保留完整精度。
|
||
|
||
| 模型 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ |
|
||
|---|---:|---:|---:|---:|---:|
|
||
| C0 | 0.5907 | 0.5573 | 0.7268 | 0.9494 | 0.5186 |
|
||
| C1 | 0.5879 | 0.4739 | 0.7446 | 0.9823 | 0.5362 |
|
||
| C2 | 0.5962 | 0.4503 | 0.6982 | 0.9260 | 0.5808 |
|
||
| C3 | 0.5907 | 0.4433 | 0.7318 | 0.9857 | 0.5457 |
|
||
| C4 | 0.5549 | 0.4536 | 0.7454 | 1.0156 | 0.5033 |
|
||
| C5 | 0.5824 | 0.4401 | 0.7788 | 1.0248 | 0.5123 |
|
||
| C6 | 0.6085 | 0.5188 | 0.6847 | 0.9208 | **0.6102** |
|
||
| C6 去距离/跨度惩罚 | 0.6071 | 0.4721 | 0.7118 | 0.9323 | 0.6075 |
|
||
| C6 去辅助重构 | 0.5838 | 0.4833 | 0.7092 | 0.9543 | 0.5635 |
|
||
| C6 点遮蔽 | 0.5810 | 0.5026 | 0.6792 | 0.9176 | 0.5959 |
|
||
| C7 蒸馏 | 0.5920 | 0.4871 | 0.7025 | 0.9442 | 0.5753 |
|
||
| C7 分组风险 | 0.6003 | 0.4509 | 0.7323 | 0.9356 | 0.6008 |
|
||
| EarlyConcat + BiGRU | **0.6236** | **0.5779** | 0.6614 | 0.8731 | 0.6092 |
|
||
| MoFE-7 + MLP Router | 0.6140 | 0.5661 | **0.6426** | **0.8499** | 0.6014 |
|
||
|
||
自然缺失验证集上,EarlyConcat 的 Accuracy 和 Macro-F1 点估计最高,MoFE 的 MAE/RMSE 最低;C6 的 Pearson 在 14 个版本中最高。数学分支内部,C0 的 Macro-F1 最高,C6 的 Accuracy/Pearson 最高,C6 点遮蔽的 MAE/RMSE 最低。以上为单种子点估计,不据此声称统计显著。
|
||
|
||
#### 官方测试集结果
|
||
|
||
| 模型 | Accuracy ↑ | Macro-F1 ↑ | MAE ↓ | RMSE ↓ | Pearson ↑ |
|
||
|---|---:|---:|---:|---:|---:|
|
||
| C6(数学分支内部选择) | **0.6726** | 0.5485 | 0.7100 | 0.9693 | 0.6424 |
|
||
| EarlyConcat + BiGRU | 0.6699 | 0.5870 | 0.6851 | 0.9017 | **0.6613** |
|
||
| MoFE-7 + MLP Router | 0.6630 | **0.5879** | **0.6702** | **0.8895** | 0.6447 |
|
||
|
||
数学 C6 在 727 条测试样本上的 300 次来源视频组 Bootstrap 95% 区间为 Accuracy [0.6337, 0.7084]、Macro-F1 [0.5108, 0.5872]、MAE [0.6579, 0.7620]、RMSE [0.8732, 1.0580]、Pearson [0.5640, 0.7087]。EarlyConcat 与 MoFE 的 1,000 次配对来源视频组 Bootstrap 比较如下,差值定义为 MoFE − EarlyConcat:
|
||
|
||
| 指标 | 差值 | 95% Bootstrap 区间 |
|
||
|---|---:|---:|
|
||
| Accuracy | -0.0069 | [-0.0303, 0.0147] |
|
||
| Macro-F1 | +0.0009 | [-0.0312, 0.0295] |
|
||
| MAE | -0.0148 | [-0.0429, 0.0136] |
|
||
| RMSE | -0.0121 | [-0.0448, 0.0191] |
|
||
| Pearson | -0.0166 | [-0.0384, 0.0053] |
|
||
|
||
这五个区间均跨零。Bootstrap 以来源视频组重采样,表示当前测试组上的抽样不确定性;本轮只有一个训练 seed,不能表示不同随机种子间的波动。
|
||
|
||
#### 连续缺失曲线表现
|
||
|
||
两条流水线均在官方验证集上评估 42 个固定遮蔽情景。下表把单模态、同步、部分重叠和异步四类 0%/10%/30%/50%/70% 遮蔽曲线压缩为归一化梯形 MAE 面积(AURC-MAE),按实际新增缺失率积分,越低越好。表中为点估计;各方案的训练目标与预处理仍有差别。
|
||
|
||
| 模型 | 单模态 | 同步 | 部分重叠 | 异步 |
|
||
|---|---:|---:|---:|---:|
|
||
| C0 | 0.7425 | 0.7643 | 0.7578 | 0.7696 |
|
||
| C1 | 0.7431 | 0.7849 | 0.7343 | 0.7406 |
|
||
| C2 | 0.7279 | 0.7444 | 0.7409 | 0.7512 |
|
||
| C3 | 0.7449 | 0.7573 | 0.7562 | 0.7577 |
|
||
| C4 | 0.7544 | 0.7610 | 0.7660 | 0.7770 |
|
||
| C5 | 0.7921 | 0.8176 | 0.8084 | 0.8118 |
|
||
| C6 | 0.7028 | 0.7237 | 0.7292 | 0.7283 |
|
||
| C6 去距离/跨度惩罚 | 0.7242 | 0.7387 | 0.7366 | 0.7333 |
|
||
| C6 去辅助重构 | 0.7128 | 0.7382 | 0.7271 | 0.7429 |
|
||
| C6 点遮蔽 | 0.6824 | 0.6988 | 0.6866 | 0.6951 |
|
||
| C7 蒸馏 | 0.7215 | 0.7468 | 0.7420 | 0.7359 |
|
||
| C7 分组风险 | 0.7437 | 0.7452 | 0.7453 | 0.7501 |
|
||
| EarlyConcat + BiGRU | 0.6613 | 0.6579 | 0.6493 | 0.6551 |
|
||
| MoFE-7 + MLP Router | **0.6509** | **0.6472** | **0.6417** | **0.6525** |
|
||
|
||
在两种深度学习方案之间,MoFE − EarlyConcat 的 AURC-MAE 配对 95% 区间分别为:单模态 -0.0104 [-0.0347, 0.0111]、同步 -0.0107 [-0.0322, 0.0093]、部分重叠 -0.0075 [-0.0280, 0.0112]、异步 -0.0026 [-0.0219, 0.0149];均跨零。数学分支 C6 的四种 AURC 点估计均低于 C0,但这是描述性点差;不把它解读为跨随机种子的稳健优势。
|
||
|
||
完整精度及审计文件:[14 个版本验证指标](output/q2/comparison_validation.csv) · [3 个正式测试结果](output/q2/comparison_test.csv) · [全部版本 AURC-MAE](output/q2/comparison_aurc.csv) · [数学运行清单](experiments/q2/unaligned_math_all_b128/run_manifest.json) · [深度学习运行清单](experiments/q2/unaligned_deep_two_b128/run_manifest.json) · [数学 42 情景明细(gzip CSV)](experiments/q2/unaligned_math_all_b128/controlled_missingness.csv.gz) · [深度学习 42 情景明细](experiments/q2/unaligned_deep_two_b128/controlled_metrics_by_scenario.csv) · [深度学习测试配对 Bootstrap](experiments/q2/unaligned_deep_two_b128/official_test_paired_bootstrap.csv)。
|
||
|
||
## Q3:ATI–HO 锚定交互与分层 Owen 归因
|
||
|
||
本轮按用户更正后的 ATI–HO 方案完成 Q3 训练与评估。输入使用官方 `unaligned_50.pkl`,经统一 Q1 adapter 转成 50 个 Relative-Progress 槽,复用仅由训练集拟合的 Q2 robust scaler。训练/验证/测试为 3,395/728/727 条,来源视频组为 1,528/239/381,组间无重叠。相对进度统一序列顺序,不代表物理时间同步。
|
||
|
||
### 训练与选型
|
||
|
||
Stage I 用 seed 42 训练 A0/A1/A2/A3 和未锚定诊断 D0;Stage II 对 EarlyConcat + BiGRU、MoFE-7 + MLP Router、Stage I 初选方案及两项关键消融使用 seeds 42、3407、2026。按锁定验证集四个固定遮蔽场景任务损失的三 seed 均值选择最终模型。Stage I 初选 A2;Stage II 三 seed 选出 **A0(仅锚定主效应)**:
|
||
|
||
| ATI 方案 | 固定场景验证损失(均值 ± 标准差) |
|
||
|---|---:|
|
||
| A0 | **0.86580 ± 0.00920** |
|
||
| A1(秩 4 pairwise) | 0.86728 ± 0.01282 |
|
||
| A2(锚定交叉注意力) | 0.86859 ± 0.01014 |
|
||
|
||
结果不支持在最终模型中保留更复杂的 pairwise 分支;A1/A2 仍作为消融完整留档。附件 4 标签未参与训练、选型和结果计算。
|
||
|
||
### 官方验证集性能
|
||
|
||
表中数值为三 seed 均值 ± 标准差;分类保留 negative/neutral/positive 三类。
|
||
|
||
| 模型 | Seeds | Accuracy ↑ | Macro-F1 ↑ | 强度 MAE ↓ | Pearson ↑ |
|
||
|---|---:|---:|---:|---:|---:|
|
||
| EarlyConcat + BiGRU | 3 | 0.632 ± 0.010 | 0.594 ± 0.018 | **0.629 ± 0.008** | **0.621 ± 0.003** |
|
||
| MoFE-7 + MLP Router | 3 | 0.624 ± 0.010 | **0.598 ± 0.009** | 0.639 ± 0.004 | 0.614 ± 0.004 |
|
||
| ATI–HO A0 | 3 | **0.633 ± 0.002** | 0.593 ± 0.010 | 0.740 ± 0.015 | 0.565 ± 0.003 |
|
||
|
||
A0 的 Accuracy 点估计略高,但 Macro-F1 接近两条基线,强度 MAE 和 Pearson 明显较弱。因此“最终选中”只表示它在预先规定的组合验证损失上均值最低,不表示它在所有指标上优于基线。
|
||
|
||
按验证视频组进行 1,000 次配对 Bootstrap。正值表示 ATI–HO 更好;MAE 差值定义为“基线 MAE − ATI–HO MAE”。所有区间均为 95%:
|
||
|
||
| 对比 | 指标 | 差值 | Bootstrap 区间 |
|
||
|---|---|---:|---:|
|
||
| A0 − EarlyConcat | Accuracy | +0.0027 | [-0.0157, 0.0218] |
|
||
| A0 − EarlyConcat | Macro-F1 | +0.0044 | [-0.0192, 0.0287] |
|
||
| EarlyConcat MAE − A0 MAE | MAE | -0.1211 | [-0.1553, -0.0892] |
|
||
| A0 − EarlyConcat | Pearson | -0.0619 | [-0.0922, -0.0338] |
|
||
| A0 − MoFE | Accuracy | +0.0000 | [-0.0177, 0.0182] |
|
||
| A0 − MoFE | Macro-F1 | -0.0118 | [-0.0329, 0.0079] |
|
||
| MoFE MAE − A0 MAE | MAE | -0.1158 | [-0.1488, -0.0835] |
|
||
| A0 − MoFE | Pearson | -0.0571 | [-0.0863, -0.0268] |
|
||
|
||
分类差异区间跨零;连续强度指标显示 A0 在当前验证组上弱于两条基线。Bootstrap 描述固定训练检查点在验证视频组上的抽样不确定性,不代表训练 seed 不确定性。
|
||
|
||
### 结构与解释审计
|
||
|
||
ATI 参数向量为三个居中类别 logit 与负/正条件强度参数;A0 的输出按锚定主效应加和重构,训练后最大重构残差为 0。A0–A3 的锚定结构检查通过;D0 未锚定诊断用于检查缺失模态基线泄漏。
|
||
|
||
最终 A0 在 728 条验证样本上的解析分类 Shapley 与 8 个模态联盟精确枚举通过率为 100%,最大绝对误差 6.81×10⁻⁷(容差 1e-6 绝对误差加 1e-5 相对误差)。Attachment 4 的 20 个无标签样本通过率也为 100%。类别选择和 sigmoid 解码后的强度输出为非线性量,因此强度贡献直接用 8 联盟精确枚举,没有套用参数线性分解。
|
||
|
||
Attachment 4 的 Hierarchical Owen 归因按三模态外层分组、每模态 10 个相对进度片段内层分组,从 8 次随机排列开始并依据稳定性增加至最多 64 次。20 个样本的最大守恒残差为 4.41×10⁻⁶。删除/保留诊断采用 10%/20%/30% 预算,并以同模态、同片段数随机选择作对照;这些数值是模型遮挡响应,不是人工解释准确率或因果效应。训练 seed 与 1% 输入扰动稳定性分别记录在 [稳定性审计表](experiments/q3/ati_ho/results/ati_ho/stability_results.csv)。
|
||
|
||
本轮 14/20 个附件 4 样本在最多 64 次排列内满足 Owen 停止条件,平均 45.6 次。30% 删除时,ATI–HO 选中的局部片段使固定 logit margin 平均下降 0.433;同模态、同片段数随机片段下降 0.112。训练 seed 归因的平均相关为 0.252、top-5 Jaccard 为 0.380,说明细粒度位置排序存在 seed 波动;1% 输入扰动下的五个诊断样本保持了相同 top-5 证据。A0 每 seed 有 127,020 个可训练参数,三 seed 集成单样本推理约 4.842 ms;8 联盟 Shapley 约 0.044 秒/样本,Owen 约 0.131 秒/样本(RTX 5070 Ti)。这些时间只表示本轮运行环境。
|
||
|
||
### 题目输出和完整材料
|
||
|
||
题目输出目录 `output/q3/ati_ho/` 仅放附件 4 的预测与解释交付件:`attachment4_predictions.csv`(20 行类别、强度及概率)、`attachment4_explanations.csv`(参数分解及 Shapley)、`attachment4_local_evidence.csv`(Owen 片段贡献)、`attachment4_prediction_manifest.json`(输入/模型哈希和审计范围)。附件 4 没有标签,不报告其准确率或误差。
|
||
|
||
工作区 `experiments/q3/ati_ho/` 保留完整候选与基线权重,以及逐 seed 指标、验证集 Shapley、Bootstrap、结构、Owen、fidelity、稳定性和复杂度结果。精简提交包包含最终 A0 三 seed 权重和完整结果表。主要文档:[实验结果](experiments/q3/ati_ho/results/ati_ho/ATI_HO_RESULTS.md) · [论文式报告](experiments/q3/ati_ho/results/ati_ho/ATI_HO_PAPER.md) · [验收摘要](experiments/q3/ati_ho/results/ati_ho/EXECUTIVE_SUMMARY.md) · [运行清单](experiments/q3/ati_ho/results/ati_ho/run_manifest.json) · [三 seed 指标表](experiments/q3/ati_ho/results/ati_ho/main_results.csv) · [视频组 Bootstrap](experiments/q3/ati_ho/results/ati_ho/bootstrap_results.csv) · [Owen 与 fidelity 明细](experiments/q3/ati_ho/results/ati_ho/owen_audit.csv) · [稳定性审计](experiments/q3/ati_ho/results/ati_ho/stability_results.csv) · [附件 4 预测](output/q3/ati_ho/attachment4_predictions.csv) · [附件 4 局部证据](output/q3/ati_ho/attachment4_local_evidence.csv)。
|
||
|
||
模型定义在 `model/ati_ho.py` 与 `model/ati_ho_config.py`,训练和评估命令见 [Q3 运行说明](q3/ati_ho/README.md)。此前 MoFE 第一轮解释与 Router 热力图已从题目输出目录移入工作区历史记录;当前 Q3 结果以 ATI–HO 为准。
|