# 问题一 B0-B4 模型对比结果 本报告按 `math/问题一.pdf` 第 4.8.3 节实施五组单因素对照。全部 100 条附件一视频均使用同一套冻结特征抽取器、0.1 秒主时间网格、观测掩码与按 `video_id` 分组的五折划分。情感标签仅用于折内的轻量预测探针,不进入时间对齐、CTC 后验或动态签名计算。 ## 实际特征和比较版本 | 版本 | 实施内容 | | --- | --- | | B0 | CTC Viterbi 词区间与音频/视觉物理时间区间投影;训练折均值/标准差缩放;视觉旋转向量和视线向量作普通分量均值。 | | B1 | 在 B0 上改用训练折中位数与 MAD 的稳健尺度(MAD 为零时回退到训练折标准差),并对视觉旋转用 SO(3) 均值、视线用归一化向量均值。 | | B2 | 在 B1 上只将文本词向量的硬边界投影替换为固定转写 CTC 状态图的前向–后向占据概率投影;媒体时间戳仍按物理时间。 | | B3 | 在 B1 上仅附加音频 log-F0/能量与视觉 jaw-open/嘴部开合率的时间增广一、二阶路径签名;缺测点之间不连线。 | | B4 | 在 B1 上仅附加冻结 Wav2Vec2-base-960h 最后四层的时间投影表示。 | 附件一现有标签表和原始视频被直接使用。文本为 768 维 BERT-base-uncased 末四层均值;音频为 74 维(log-Mel 40、MFCC 13、ΔMFCC 13、韵律/谱统计 8);视觉为 35 维(17 个 MediaPipe blendshape 代理、6 维头姿、6 维近似视线、6 维面部比例几何)。视觉代理和几何索引定义见 `compare_models.py`,它们与 OpenFace AU 定义并不等同;该限制须在论文中明示。 ## 结果 分类按连续标签的严格符号构造 Negative/Neutral/Positive,强度预测限幅到 [-3, 3]。每折训练折单独拟合标准化器、逻辑回归(C=0.05)与 Ridge(alpha=25);固定五折由 GroupKFold 按原始 `video_id` 分组。总体 OOF 指标按 100 条留组预测计算。 | 方法 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF Pearson | Macro-F1 折均值±SD | | --- | ---: | ---: | ---: | ---: | ---: | | B0 | 0.600 | 0.361 | 0.564 | 0.346 | 0.337 ± 0.098 | | B1 | 0.610 | 0.387 | 0.599 | 0.238 | 0.349 ± 0.119 | | B2 | 0.580 | 0.331 | 0.588 | 0.279 | 0.313 ± 0.087 | | B3 | 0.590 | 0.359 | 0.600 | 0.230 | 0.333 ± 0.096 | | B4 | 0.600 | 0.422 | 0.593 | 0.199 | 0.398 ± 0.089 | 按当前 OOF 探针,Macro-F1 最高的是 B4(0.422),MAE 最低的是 B0(0.564)。相对 B1,B4 的 Macro-F1 差为 +0.035,视频组 Bootstrap 95% 区间 [-0.051, +0.137],区间跨过零。B0 的 MAE 差为 -0.035,区间 [-0.063, -0.012],Pearson 差为 +0.108。B2 的 Macro-F1 差为 -0.057,区间 [-0.109, -0.001],MAE 差为 -0.011;B3 的 Macro-F1 差为 -0.029,区间 [-0.072, +0.000]。组 Bootstrap 只反映当前 37 个来源视频上的抽样不确定性,未作多重比较校正。 ## 覆盖与对齐核验 样本数:100;标签表连续标签与极性一致 100/100;CTC 硬对齐完整的样本 91/100。B0 硬区间平均文本覆盖率为 0.673,B2 平均词占据后验质量为 0.229(这是期望占据率,不是覆盖率);视觉检测覆盖率(按 0.1 秒网格平均)为 0.859。后验内部 90% 边界区间平均宽度为起点 0.131 秒、终点 0.111 秒。没有人工边界子集,因此这些宽度只是模型内部不确定性摘要,不是经验校准率或边界误差。 B0–B4 的特征来源、有效掩码、连续覆盖率、词边界后验宽度、折内预测及视频哈希均分别保存在配套 CSV/JSON 中。没有人工词边界时不报告 IoU/MATE,也不把不同方法的预测探针分数解释为对齐真值。 ## 文件 - `comparison_summary.csv`:五种方法总体 OOF 与折均值指标。 - `fold_metrics.csv`:每折分类/回归指标与特征维数。 - `oof_predictions.csv`:每条样本的留组预测。 - `group_bootstrap_deltas.csv`:相对 B1 的视频组配对 Bootstrap 95% 区间。 - `sample_alignment_summary.csv`:100 条样本、硬/概率文本覆盖和后验边界宽度。 - `modality_summary.csv`:300 行样本-模态明细。 - `word_alignment_posterior.csv`:逐词硬边界、实际相对质量权重及后验边界区间。 - `split_assignments.csv`:逐样本折号。 - `comparison.png`:核心 OOF 指标图。 - `typical_alignment_example.png`:中位时长样本的词边界、覆盖率、声学/视觉轨迹与视频帧核验图。 - `run_manifest.json`:环境、模型 revision、参数、哈希与运行时间。 ## 复现 在仓库根目录执行: ```bash cd math uv sync uv run python compare_models.py ``` 特征缓存写在 `math/cache/native/`,正式结果只写在 `math/results/model_comparison/`。删除缓存后会从附件一重新提取。首次运行需要下载 BERT、Wav2Vec2 和 MediaPipe Face Landmarker 权重。