Files
modeling_zhaocui/math/results/model_comparison/report.md
T

62 lines
4.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 问题一 B0-B4 模型对比结果
本报告按 `math/问题一.pdf` 第 4.8.3 节实施五组单因素对照。全部 100 条附件一视频均使用同一套冻结特征抽取器、0.1 秒主时间网格、观测掩码与按 `video_id` 分组的五折划分。情感标签仅用于折内的轻量预测探针,不进入时间对齐、CTC 后验或动态签名计算。
## 实际特征和比较版本
| 版本 | 实施内容 |
| --- | --- |
| B0 | CTC Viterbi 词区间与音频/视觉物理时间区间投影;训练折均值/标准差缩放;视觉旋转向量和视线向量作普通分量均值。 |
| B1 | 在 B0 上改用训练折中位数与 MAD 的稳健尺度(MAD 为零时回退到训练折标准差),并对视觉旋转用 SO(3) 均值、视线用归一化向量均值。 |
| B2 | 在 B1 上只将文本词向量的硬边界投影替换为固定转写 CTC 状态图的前向–后向占据概率投影;媒体时间戳仍按物理时间。 |
| B3 | 在 B1 上仅附加音频 log-F0/能量与视觉 jaw-open/嘴部开合率的时间增广一、二阶路径签名;缺测点之间不连线。 |
| B4 | 在 B1 上仅附加冻结 Wav2Vec2-base-960h 最后四层的时间投影表示。 |
附件一现有标签表和原始视频被直接使用。文本为 768 维 BERT-base-uncased 末四层均值;音频为 74 维(log-Mel 40、MFCC 13、ΔMFCC 13、韵律/谱统计 8);视觉为 35 维(17 个 MediaPipe blendshape 代理、6 维头姿、6 维近似视线、6 维面部比例几何)。视觉代理和几何索引定义见 `compare_models.py`,它们与 OpenFace AU 定义并不等同;该限制须在论文中明示。
## 结果
分类按连续标签的严格符号构造 Negative/Neutral/Positive,强度预测限幅到 [-3, 3]。每折训练折单独拟合标准化器、逻辑回归(C=0.05)与 Ridge(alpha=25);固定五折由 GroupKFold 按原始 `video_id` 分组。总体 OOF 指标按 100 条留组预测计算。
| 方法 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF Pearson | Macro-F1 折均值±SD |
| --- | ---: | ---: | ---: | ---: | ---: |
| B0 | 0.600 | 0.361 | 0.564 | 0.346 | 0.337 ± 0.098 |
| B1 | 0.610 | 0.387 | 0.599 | 0.238 | 0.349 ± 0.119 |
| B2 | 0.580 | 0.331 | 0.588 | 0.279 | 0.313 ± 0.087 |
| B3 | 0.590 | 0.359 | 0.600 | 0.230 | 0.333 ± 0.096 |
| B4 | 0.600 | 0.422 | 0.593 | 0.199 | 0.398 ± 0.089 |
按当前 OOF 探针,Macro-F1 最高的是 B4(0.422),MAE 最低的是 B0(0.564)。相对 B1,B4 的 Macro-F1 差为 +0.035,视频组 Bootstrap 95% 区间 [-0.051, +0.137],区间跨过零。B0 的 MAE 差为 -0.035,区间 [-0.063, -0.012],Pearson 差为 +0.108。B2 的 Macro-F1 差为 -0.057,区间 [-0.109, -0.001],MAE 差为 -0.011;B3 的 Macro-F1 差为 -0.029,区间 [-0.072, +0.000]。组 Bootstrap 只反映当前 37 个来源视频上的抽样不确定性,未作多重比较校正。
## 覆盖与对齐核验
样本数:100;标签表连续标签与极性一致 100/100;CTC 硬对齐完整的样本 91/100。B0 硬区间平均文本覆盖率为 0.673,B2 平均词占据后验质量为 0.229(这是期望占据率,不是覆盖率);视觉检测覆盖率(按 0.1 秒网格平均)为 0.859。后验内部 90% 边界区间平均宽度为起点 0.131 秒、终点 0.111 秒。没有人工边界子集,因此这些宽度只是模型内部不确定性摘要,不是经验校准率或边界误差。
B0–B4 的特征来源、有效掩码、连续覆盖率、词边界后验宽度、折内预测及视频哈希均分别保存在配套 CSV/JSON 中。没有人工词边界时不报告 IoU/MATE,也不把不同方法的预测探针分数解释为对齐真值。
## 文件
- `comparison_summary.csv`:五种方法总体 OOF 与折均值指标。
- `fold_metrics.csv`:每折分类/回归指标与特征维数。
- `oof_predictions.csv`:每条样本的留组预测。
- `group_bootstrap_deltas.csv`:相对 B1 的视频组配对 Bootstrap 95% 区间。
- `sample_alignment_summary.csv`:100 条样本、硬/概率文本覆盖和后验边界宽度。
- `modality_summary.csv`:300 行样本-模态明细。
- `word_alignment_posterior.csv`:逐词硬边界、实际相对质量权重及后验边界区间。
- `split_assignments.csv`:逐样本折号。
- `comparison.png`:核心 OOF 指标图。
- `typical_alignment_example.png`:中位时长样本的词边界、覆盖率、声学/视觉轨迹与视频帧核验图。
- `run_manifest.json`:环境、模型 revision、参数、哈希与运行时间。
## 复现
在仓库根目录执行:
```bash
cd math
uv sync
uv run python compare_models.py
```
特征缓存写在 `math/cache/native/`,正式结果只写在 `math/results/model_comparison/`。删除缓存后会从附件一重新提取。首次运行需要下载 BERT、Wav2Vec2 和 MediaPipe Face Landmarker 权重。