Files
modeling_zhaocui/math/results/model_comparison/report.md
T

4.8 KiB
Raw Blame History

问题一 B0-B4 模型对比结果

本报告按 math/问题一.pdf 第 4.8.3 节实施五组单因素对照。全部 100 条附件一视频均使用同一套冻结特征抽取器、0.1 秒主时间网格、观测掩码与按 video_id 分组的五折划分。情感标签仅用于折内的轻量预测探针,不进入时间对齐、CTC 后验或动态签名计算。

实际特征和比较版本

版本 实施内容
B0 CTC Viterbi 词区间与音频/视觉物理时间区间投影;训练折均值/标准差缩放;视觉旋转向量和视线向量作普通分量均值。
B1 在 B0 上改用训练折中位数与 MAD 的稳健尺度(MAD 为零时回退到训练折标准差),并对视觉旋转用 SO(3) 均值、视线用归一化向量均值。
B2 在 B1 上只将文本词向量的硬边界投影替换为固定转写 CTC 状态图的前向–后向占据概率投影;媒体时间戳仍按物理时间。
B3 在 B1 上仅附加音频 log-F0/能量与视觉 jaw-open/嘴部开合率的时间增广一、二阶路径签名;缺测点之间不连线。
B4 在 B1 上仅附加冻结 Wav2Vec2-base-960h 最后四层的时间投影表示。

附件一现有标签表和原始视频被直接使用。文本为 768 维 BERT-base-uncased 末四层均值;音频为 74 维(log-Mel 40、MFCC 13、ΔMFCC 13、韵律/谱统计 8);视觉为 35 维(17 个 MediaPipe blendshape 代理、6 维头姿、6 维近似视线、6 维面部比例几何)。视觉代理和几何索引定义见 compare_models.py,它们与 OpenFace AU 定义并不等同;该限制须在论文中明示。

结果

分类按连续标签的严格符号构造 Negative/Neutral/Positive,强度预测限幅到 [-3, 3]。每折训练折单独拟合标准化器、逻辑回归(C=0.05)与 Ridge(alpha=25);固定五折由 GroupKFold 按原始 video_id 分组。总体 OOF 指标按 100 条留组预测计算。

方法 OOF Accuracy OOF Macro-F1 OOF MAE OOF Pearson Macro-F1 折均值±SD
B0 0.600 0.361 0.564 0.346 0.337 ± 0.098
B1 0.610 0.387 0.599 0.238 0.349 ± 0.119
B2 0.580 0.331 0.588 0.279 0.313 ± 0.087
B3 0.590 0.359 0.600 0.230 0.333 ± 0.096
B4 0.600 0.422 0.593 0.199 0.398 ± 0.089

按当前 OOF 探针,Macro-F1 最高的是 B4(0.422),MAE 最低的是 B0(0.564)。相对 B1,B4 的 Macro-F1 差为 +0.035,视频组 Bootstrap 95% 区间 [-0.051, +0.137],区间跨过零。B0 的 MAE 差为 -0.035,区间 [-0.063, -0.012],Pearson 差为 +0.108。B2 的 Macro-F1 差为 -0.057,区间 [-0.109, -0.001],MAE 差为 -0.011;B3 的 Macro-F1 差为 -0.029,区间 [-0.072, +0.000]。组 Bootstrap 只反映当前 37 个来源视频上的抽样不确定性,未作多重比较校正。

覆盖与对齐核验

样本数:100;标签表连续标签与极性一致 100/100;CTC 硬对齐完整的样本 91/100。B0 硬区间平均文本覆盖率为 0.673,B2 平均词占据后验质量为 0.229(这是期望占据率,不是覆盖率);视觉检测覆盖率(按 0.1 秒网格平均)为 0.859。后验内部 90% 边界区间平均宽度为起点 0.131 秒、终点 0.111 秒。没有人工边界子集,因此这些宽度只是模型内部不确定性摘要,不是经验校准率或边界误差。

B0–B4 的特征来源、有效掩码、连续覆盖率、词边界后验宽度、折内预测及视频哈希均分别保存在配套 CSV/JSON 中。没有人工词边界时不报告 IoU/MATE,也不把不同方法的预测探针分数解释为对齐真值。

文件

  • comparison_summary.csv:五种方法总体 OOF 与折均值指标。
  • fold_metrics.csv:每折分类/回归指标与特征维数。
  • oof_predictions.csv:每条样本的留组预测。
  • group_bootstrap_deltas.csv:相对 B1 的视频组配对 Bootstrap 95% 区间。
  • sample_alignment_summary.csv:100 条样本、硬/概率文本覆盖和后验边界宽度。
  • modality_summary.csv:300 行样本-模态明细。
  • word_alignment_posterior.csv:逐词硬边界、实际相对质量权重及后验边界区间。
  • split_assignments.csv:逐样本折号。
  • comparison.png:核心 OOF 指标图。
  • typical_alignment_example.png:中位时长样本的词边界、覆盖率、声学/视觉轨迹与视频帧核验图。
  • run_manifest.json:环境、模型 revision、参数、哈希与运行时间。

复现

在仓库根目录执行:

cd math
uv sync
uv run python compare_models.py

特征缓存写在 math/cache/native/,正式结果只写在 math/results/model_comparison/。删除缓存后会从附件一重新提取。首次运行需要下载 BERT、Wav2Vec2 和 MediaPipe Face Landmarker 权重。