4.8 KiB
问题一 B0-B4 模型对比结果
本报告按 math/问题一.pdf 第 4.8.3 节实施五组单因素对照。全部 100 条附件一视频均使用同一套冻结特征抽取器、0.1 秒主时间网格、观测掩码与按 video_id 分组的五折划分。情感标签仅用于折内的轻量预测探针,不进入时间对齐、CTC 后验或动态签名计算。
实际特征和比较版本
| 版本 | 实施内容 |
|---|---|
| B0 | CTC Viterbi 词区间与音频/视觉物理时间区间投影;训练折均值/标准差缩放;视觉旋转向量和视线向量作普通分量均值。 |
| B1 | 在 B0 上改用训练折中位数与 MAD 的稳健尺度(MAD 为零时回退到训练折标准差),并对视觉旋转用 SO(3) 均值、视线用归一化向量均值。 |
| B2 | 在 B1 上只将文本词向量的硬边界投影替换为固定转写 CTC 状态图的前向–后向占据概率投影;媒体时间戳仍按物理时间。 |
| B3 | 在 B1 上仅附加音频 log-F0/能量与视觉 jaw-open/嘴部开合率的时间增广一、二阶路径签名;缺测点之间不连线。 |
| B4 | 在 B1 上仅附加冻结 Wav2Vec2-base-960h 最后四层的时间投影表示。 |
附件一现有标签表和原始视频被直接使用。文本为 768 维 BERT-base-uncased 末四层均值;音频为 74 维(log-Mel 40、MFCC 13、ΔMFCC 13、韵律/谱统计 8);视觉为 35 维(17 个 MediaPipe blendshape 代理、6 维头姿、6 维近似视线、6 维面部比例几何)。视觉代理和几何索引定义见 compare_models.py,它们与 OpenFace AU 定义并不等同;该限制须在论文中明示。
结果
分类按连续标签的严格符号构造 Negative/Neutral/Positive,强度预测限幅到 [-3, 3]。每折训练折单独拟合标准化器、逻辑回归(C=0.05)与 Ridge(alpha=25);固定五折由 GroupKFold 按原始 video_id 分组。总体 OOF 指标按 100 条留组预测计算。
| 方法 | OOF Accuracy | OOF Macro-F1 | OOF MAE | OOF Pearson | Macro-F1 折均值±SD |
|---|---|---|---|---|---|
| B0 | 0.600 | 0.361 | 0.564 | 0.346 | 0.337 ± 0.098 |
| B1 | 0.610 | 0.387 | 0.599 | 0.238 | 0.349 ± 0.119 |
| B2 | 0.580 | 0.331 | 0.588 | 0.279 | 0.313 ± 0.087 |
| B3 | 0.590 | 0.359 | 0.600 | 0.230 | 0.333 ± 0.096 |
| B4 | 0.600 | 0.422 | 0.593 | 0.199 | 0.398 ± 0.089 |
按当前 OOF 探针,Macro-F1 最高的是 B4(0.422),MAE 最低的是 B0(0.564)。相对 B1,B4 的 Macro-F1 差为 +0.035,视频组 Bootstrap 95% 区间 [-0.051, +0.137],区间跨过零。B0 的 MAE 差为 -0.035,区间 [-0.063, -0.012],Pearson 差为 +0.108。B2 的 Macro-F1 差为 -0.057,区间 [-0.109, -0.001],MAE 差为 -0.011;B3 的 Macro-F1 差为 -0.029,区间 [-0.072, +0.000]。组 Bootstrap 只反映当前 37 个来源视频上的抽样不确定性,未作多重比较校正。
覆盖与对齐核验
样本数:100;标签表连续标签与极性一致 100/100;CTC 硬对齐完整的样本 91/100。B0 硬区间平均文本覆盖率为 0.673,B2 平均词占据后验质量为 0.229(这是期望占据率,不是覆盖率);视觉检测覆盖率(按 0.1 秒网格平均)为 0.859。后验内部 90% 边界区间平均宽度为起点 0.131 秒、终点 0.111 秒。没有人工边界子集,因此这些宽度只是模型内部不确定性摘要,不是经验校准率或边界误差。
B0–B4 的特征来源、有效掩码、连续覆盖率、词边界后验宽度、折内预测及视频哈希均分别保存在配套 CSV/JSON 中。没有人工词边界时不报告 IoU/MATE,也不把不同方法的预测探针分数解释为对齐真值。
文件
comparison_summary.csv:五种方法总体 OOF 与折均值指标。fold_metrics.csv:每折分类/回归指标与特征维数。oof_predictions.csv:每条样本的留组预测。group_bootstrap_deltas.csv:相对 B1 的视频组配对 Bootstrap 95% 区间。sample_alignment_summary.csv:100 条样本、硬/概率文本覆盖和后验边界宽度。modality_summary.csv:300 行样本-模态明细。word_alignment_posterior.csv:逐词硬边界、实际相对质量权重及后验边界区间。split_assignments.csv:逐样本折号。comparison.png:核心 OOF 指标图。typical_alignment_example.png:中位时长样本的词边界、覆盖率、声学/视觉轨迹与视频帧核验图。run_manifest.json:环境、模型 revision、参数、哈希与运行时间。
复现
在仓库根目录执行:
cd math
uv sync
uv run python compare_models.py
特征缓存写在 math/cache/native/,正式结果只写在 math/results/model_comparison/。删除缓存后会从附件一重新提取。首次运行需要下载 BERT、Wav2Vec2 和 MediaPipe Face Landmarker 权重。