整理 Q1-Q3 实验代码与结果

This commit is contained in:
2026-09-24 16:25:15 +08:00
parent 0261ecdfba
commit 8f5c2c3be6
247 changed files with 69828 additions and 19 deletions
@@ -134,3 +134,13 @@ uv run python -m q1.extract_features --output-dir outputs/q1_features
为了知道“附近”是否真的有用,还做了两种对照:一种把同样宽的窗口随机放置,另一种让模型看完整段视频。七种方法使用相同的 100 条视频、相同的 BERT 文字特征、音频特征和 DeiT 图像特征;同一原视频的片段在同一折里一起作为训练或留出数据。总共做 5 折,每条样本都轮到一次留出评价。
结果显示,TSFA 比只用 M4 时更容易把同一位置的**文字与声音**对应起来,但画面相关的改善很小。随机窗口和看完整段视频的方案在“内容相似度”指标上甚至更高,却经常把视频前后位置弄乱。TSFA 的局部时间窗口主要帮助模型保持先后顺序。这里的“同一位置”由时间槽定义,还不是人工确认的同一事件,因此目前不能说三种模态已经准确理解了彼此。详细数字与图见 [RESULTS.md](RESULTS.md) 的 TSFA 小节。
我们也把连续情感分数按正负号分成三类,做了一个单独的小测。TSFA 三模态预测的 Accuracy 为 `0.54`,略低于总是猜样本最多的 Positive 类所得到的 `0.57`;它的 Macro-F1 为 `0.431`,高于这个简单猜测的 `0.242`。这表示它能识别一部分少数类别,但在连续分数回归上的误差仍偏大,所以不能据此认为 TSFA 已经是成熟的情感识别模型。
## 新增检查:让声音与画面交流,并保留各自的原始线索
原来的 TSFA 像是让文字分别询问声音和画面:“你们哪些部分与我对应?”这可能漏掉声音和表情之间的直接关系,也可能在挑选“与文字对应的部分”时丢掉有用的语调或画面线索。我们分别试了两件事:让声音和画面在同一小段时间内直接交换信息;以及在挑选后的信息之外,额外保留各模态未经这次语义挑选的特征。于是得到“两个开关各开或关”的四种组合。
四种组合仍使用原来的 100 条视频、BERT/eGeMAPS/DeiT 特征、五折留出方式和同一个简单情感预测器。原版的连续情感分数平均误差为 `0.820`;只加声音与画面的直接联系后为 `0.803`,变化很小;只保留原模态线索后降至 `0.572`;两者都加则为 `0.579`。原版预测的正负类别 Macro-F1 为 `0.431`;四种组合里,原版仍最高。按来源视频成组比较后,保留原模态线索带来的回归改善比较明确,新增的声音—画面联系暂时没有显示稳定改善。
这项结果说明原版 TSFA 交给情感预测器的信息可能不够完整。额外保留的线索同时包含文字、声音和画面,所以目前还不能说改进一定来自语调或表情;新组合的输入数字也更多。详细四组结果、配对区间和图见 [RESULTS.md](RESULTS.md) 的“A–V 局部边 × 原模态残差消融”一节。