Files

255 lines
14 KiB
Plaintext

[start] samples=100 folds=5 seeds=[42, 3407, 2026] device=cuda variants=v2_a,v2_b,v2_c
[fixed fold 1/5] train=80 validation=20; evaluating unchanged M1/M2
[fixed fold 2/5] train=80 validation=20; evaluating unchanged M1/M2
[fixed fold 3/5] train=80 validation=20; evaluating unchanged M1/M2
[fixed fold 4/5] train=80 validation=20; evaluating unchanged M1/M2
[fixed fold 5/5] train=80 validation=20; evaluating unchanged M1/M2
[v2_a fold 1/5] training M3/M4 with 80 train and 20 validation clips
[v2_a fold 1] M3 seed=42 best_epoch=39 val=7.7805 C_row(audio/vision)=0.802/0.969
[v2_a fold 1] M4 seed=42 best_epoch=4 val=8.5170 C_row(audio/vision)=1.000/1.000
[v2_a fold 1] M3 seed=3407 best_epoch=45 val=7.6577 C_row(audio/vision)=0.728/0.961
[v2_a fold 1] M4 seed=3407 best_epoch=4 val=8.3070 C_row(audio/vision)=1.000/1.000
[v2_a fold 1] M3 seed=2026 best_epoch=30 val=7.8561 C_row(audio/vision)=0.855/0.987
[v2_a fold 1] M4 seed=2026 best_epoch=3 val=8.5412 C_row(audio/vision)=1.000/1.000
[v2_a fold 2/5] training M3/M4 with 80 train and 20 validation clips
[v2_a fold 2] M3 seed=42 best_epoch=1 val=8.5791 C_row(audio/vision)=0.995/0.999
[v2_a fold 2] M4 seed=42 best_epoch=1 val=8.3893 C_row(audio/vision)=1.000/1.000
[v2_a fold 2] M3 seed=3407 best_epoch=29 val=8.2238 C_row(audio/vision)=0.818/0.987
[v2_a fold 2] M4 seed=3407 best_epoch=3 val=8.5151 C_row(audio/vision)=1.000/1.000
[v2_a fold 2] M3 seed=2026 best_epoch=30 val=8.0788 C_row(audio/vision)=0.793/0.988
[v2_a fold 2] M4 seed=2026 best_epoch=1 val=8.4105 C_row(audio/vision)=1.000/1.000
[v2_a fold 3/5] training M3/M4 with 80 train and 20 validation clips
[v2_a fold 3] M3 seed=42 best_epoch=26 val=8.0276 C_row(audio/vision)=0.885/0.985
[v2_a fold 3] M4 seed=42 best_epoch=31 val=8.0486 C_row(audio/vision)=0.965/0.999
[v2_a fold 3] M3 seed=3407 best_epoch=25 val=8.0664 C_row(audio/vision)=0.893/0.984
[v2_a fold 3] M4 seed=3407 best_epoch=20 val=7.6810 C_row(audio/vision)=0.996/1.000
[v2_a fold 3] M3 seed=2026 best_epoch=27 val=8.0816 C_row(audio/vision)=0.836/0.979
[v2_a fold 3] M4 seed=2026 best_epoch=3 val=8.4686 C_row(audio/vision)=1.000/1.000
[v2_a fold 4/5] training M3/M4 with 80 train and 20 validation clips
[v2_a fold 4] M3 seed=42 best_epoch=25 val=8.1088 C_row(audio/vision)=0.857/0.988
[v2_a fold 4] M4 seed=42 best_epoch=1 val=8.4480 C_row(audio/vision)=1.000/1.000
[v2_a fold 4] M3 seed=3407 best_epoch=29 val=8.0979 C_row(audio/vision)=0.843/0.976
[v2_a fold 4] M4 seed=3407 best_epoch=2 val=8.4787 C_row(audio/vision)=1.000/1.000
[v2_a fold 4] M3 seed=2026 best_epoch=31 val=8.1568 C_row(audio/vision)=0.823/0.985
[v2_a fold 4] M4 seed=2026 best_epoch=2 val=8.5234 C_row(audio/vision)=1.000/1.000
[v2_a fold 5/5] training M3/M4 with 80 train and 20 validation clips
[v2_a fold 5] M3 seed=42 best_epoch=33 val=7.9642 C_row(audio/vision)=0.851/0.973
[v2_a fold 5] M4 seed=42 best_epoch=4 val=8.4633 C_row(audio/vision)=1.000/1.000
[v2_a fold 5] M3 seed=3407 best_epoch=36 val=7.9612 C_row(audio/vision)=0.840/0.955
[v2_a fold 5] M4 seed=3407 best_epoch=50 val=7.6178 C_row(audio/vision)=0.951/0.988
[v2_a fold 5] M3 seed=2026 best_epoch=28 val=7.9423 C_row(audio/vision)=0.890/0.973
[v2_a fold 5] M4 seed=2026 best_epoch=1 val=8.3293 C_row(audio/vision)=1.000/1.000
[v2_a done] elapsed=334.7s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2/v2_a; summary rows=48
[v2_b fold 1/5] training M3/M4 with 80 train and 20 validation clips
[v2_b fold 1] M3 seed=42 best_epoch=39 val=8.2245 C_row(audio/vision)=0.746/0.963
[v2_b fold 1] M4 seed=42 best_epoch=4 val=9.0169 C_row(audio/vision)=1.000/1.000
[v2_b fold 1] M3 seed=3407 best_epoch=45 val=8.0834 C_row(audio/vision)=0.647/0.951
[v2_b fold 1] M4 seed=3407 best_epoch=4 val=8.8069 C_row(audio/vision)=1.000/1.000
[v2_b fold 1] M3 seed=2026 best_epoch=30 val=8.2653 C_row(audio/vision)=0.791/0.984
[v2_b fold 1] M4 seed=2026 best_epoch=3 val=9.0412 C_row(audio/vision)=1.000/1.000
[v2_b fold 2/5] training M3/M4 with 80 train and 20 validation clips
[v2_b fold 2] M3 seed=42 best_epoch=1 val=9.0775 C_row(audio/vision)=0.995/0.999
[v2_b fold 2] M4 seed=42 best_epoch=1 val=8.8892 C_row(audio/vision)=1.000/1.000
[v2_b fold 2] M3 seed=3407 best_epoch=29 val=8.6745 C_row(audio/vision)=0.771/0.984
[v2_b fold 2] M4 seed=3407 best_epoch=34 val=8.4230 C_row(audio/vision)=0.872/0.999
[v2_b fold 2] M3 seed=2026 best_epoch=30 val=8.5185 C_row(audio/vision)=0.736/0.986
[v2_b fold 2] M4 seed=2026 best_epoch=1 val=8.9105 C_row(audio/vision)=1.000/1.000
[v2_b fold 3/5] training M3/M4 with 80 train and 20 validation clips
[v2_b fold 3] M3 seed=42 best_epoch=26 val=8.4752 C_row(audio/vision)=0.843/0.983
[v2_b fold 3] M4 seed=42 best_epoch=31 val=8.4967 C_row(audio/vision)=0.950/0.999
[v2_b fold 3] M3 seed=3407 best_epoch=25 val=8.5216 C_row(audio/vision)=0.856/0.982
[v2_b fold 3] M4 seed=3407 best_epoch=28 val=8.0958 C_row(audio/vision)=0.943/0.999
[v2_b fold 3] M3 seed=2026 best_epoch=27 val=8.5222 C_row(audio/vision)=0.797/0.976
[v2_b fold 3] M4 seed=2026 best_epoch=3 val=8.9686 C_row(audio/vision)=1.000/1.000
[v2_b fold 4/5] training M3/M4 with 80 train and 20 validation clips
[v2_b fold 4] M3 seed=42 best_epoch=25 val=8.5698 C_row(audio/vision)=0.814/0.986
[v2_b fold 4] M4 seed=42 best_epoch=1 val=8.9479 C_row(audio/vision)=1.000/1.000
[v2_b fold 4] M3 seed=3407 best_epoch=30 val=8.5162 C_row(audio/vision)=0.787/0.966
[v2_b fold 4] M4 seed=3407 best_epoch=2 val=8.9787 C_row(audio/vision)=1.000/1.000
[v2_b fold 4] M3 seed=2026 best_epoch=40 val=8.5877 C_row(audio/vision)=0.631/0.936
[v2_b fold 4] M4 seed=2026 best_epoch=2 val=9.0233 C_row(audio/vision)=1.000/1.000
[v2_b fold 5/5] training M3/M4 with 80 train and 20 validation clips
[v2_b fold 5] M3 seed=42 best_epoch=49 val=8.3492 C_row(audio/vision)=0.659/0.836
[v2_b fold 5] M4 seed=42 best_epoch=4 val=8.9632 C_row(audio/vision)=1.000/1.000
[v2_b fold 5] M3 seed=3407 best_epoch=42 val=8.3579 C_row(audio/vision)=0.730/0.907
[v2_b fold 5] M4 seed=3407 best_epoch=28 val=8.1570 C_row(audio/vision)=0.975/1.000
[v2_b fold 5] M3 seed=2026 best_epoch=28 val=8.3718 C_row(audio/vision)=0.847/0.969
[v2_b fold 5] M4 seed=2026 best_epoch=1 val=8.8293 C_row(audio/vision)=1.000/1.000
[v2_b done] elapsed=351.7s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2/v2_b; summary rows=48
[v2_c fold 1/5] training M3/M4 with 80 train and 20 validation clips
[v2_c fold 1] M3 seed=42 best_epoch=39 val=8.5597 C_row(audio/vision)=0.753/0.964
[v2_c fold 1] M4 seed=42 best_epoch=4 val=9.4480 C_row(audio/vision)=1.000/1.000
[v2_c fold 1] M3 seed=3407 best_epoch=45 val=8.4024 C_row(audio/vision)=0.652/0.951
[v2_c fold 1] M4 seed=3407 best_epoch=42 val=8.2771 C_row(audio/vision)=0.893/0.994
[v2_c fold 1] M3 seed=2026 best_epoch=30 val=8.5775 C_row(audio/vision)=0.795/0.983
[v2_c fold 1] M4 seed=2026 best_epoch=3 val=9.4722 C_row(audio/vision)=1.000/1.000
[v2_c fold 2/5] training M3/M4 with 80 train and 20 validation clips
[v2_c fold 2] M3 seed=42 best_epoch=1 val=9.4566 C_row(audio/vision)=0.995/0.999
[v2_c fold 2] M4 seed=42 best_epoch=1 val=9.3218 C_row(audio/vision)=1.000/1.000
[v2_c fold 2] M3 seed=3407 best_epoch=26 val=9.0674 C_row(audio/vision)=0.800/0.991
[v2_c fold 2] M4 seed=3407 best_epoch=28 val=8.6381 C_row(audio/vision)=0.888/1.000
[v2_c fold 2] M3 seed=2026 best_epoch=30 val=8.9090 C_row(audio/vision)=0.736/0.985
[v2_c fold 2] M4 seed=2026 best_epoch=1 val=9.3429 C_row(audio/vision)=1.000/1.000
[v2_c fold 3/5] training M3/M4 with 80 train and 20 validation clips
[v2_c fold 3] M3 seed=42 best_epoch=26 val=8.9050 C_row(audio/vision)=0.842/0.981
[v2_c fold 3] M4 seed=42 best_epoch=31 val=8.7508 C_row(audio/vision)=0.932/0.998
[v2_c fold 3] M3 seed=3407 best_epoch=24 val=8.9361 C_row(audio/vision)=0.862/0.984
[v2_c fold 3] M4 seed=3407 best_epoch=28 val=8.3848 C_row(audio/vision)=0.926/0.998
[v2_c fold 3] M3 seed=2026 best_epoch=26 val=8.9320 C_row(audio/vision)=0.809/0.978
[v2_c fold 3] M4 seed=2026 best_epoch=3 val=9.4028 C_row(audio/vision)=1.000/1.000
[v2_c fold 4/5] training M3/M4 with 80 train and 20 validation clips
[v2_c fold 4] M3 seed=42 best_epoch=25 val=8.9781 C_row(audio/vision)=0.811/0.985
[v2_c fold 4] M4 seed=42 best_epoch=1 val=9.3892 C_row(audio/vision)=1.000/1.000
[v2_c fold 4] M3 seed=3407 best_epoch=30 val=8.9323 C_row(audio/vision)=0.780/0.964
[v2_c fold 4] M4 seed=3407 best_epoch=2 val=9.4197 C_row(audio/vision)=1.000/1.000
[v2_c fold 4] M3 seed=2026 best_epoch=39 val=8.9793 C_row(audio/vision)=0.639/0.943
[v2_c fold 4] M4 seed=2026 best_epoch=2 val=9.4643 C_row(audio/vision)=1.000/1.000
[v2_c fold 5/5] training M3/M4 with 80 train and 20 validation clips
[v2_c fold 5] M3 seed=42 best_epoch=43 val=8.7819 C_row(audio/vision)=0.707/0.888
[v2_c fold 5] M4 seed=42 best_epoch=42 val=8.3535 C_row(audio/vision)=0.861/0.995
[v2_c fold 5] M3 seed=3407 best_epoch=42 val=8.7810 C_row(audio/vision)=0.730/0.903
[v2_c fold 5] M4 seed=3407 best_epoch=27 val=8.4597 C_row(audio/vision)=0.974/1.000
[v2_c fold 5] M3 seed=2026 best_epoch=28 val=8.7653 C_row(audio/vision)=0.847/0.965
[v2_c fold 5] M4 seed=2026 best_epoch=1 val=9.2652 C_row(audio/vision)=1.000/1.000
[v2_c done] elapsed=360.1s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2/v2_c; summary rows=48
[all done] elapsed=1086.4s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2
{
"created_utc": "2026-09-23T10:04:06.673162+00:00",
"sample_count": 100,
"group_count": 37,
"folds": 5,
"seeds": [
42,
3407,
2026
],
"device": "cuda",
"gpu_name": "NVIDIA GeForce RTX 5070 Ti",
"python": "3.14.7",
"torch": "2.14.0+cu130",
"feature_dir": "/home/gloamxun/modeling_zhaocui/Q1/outputs/q1_features/features",
"baseline_dir": "/home/gloamxun/modeling_zhaocui/Q1/outputs/method_comparison",
"variants": [
{
"variant": "v2_a",
"loss_coefficients": {
"lambda_reconstruction": 1.0,
"lambda_contrastive": 1.0,
"lambda_monotonicity": 0.1,
"lambda_span": 5.0,
"lambda_diversity": 0.0,
"lambda_band": 0.0,
"coverage_floor": 0.7,
"diversity_slot_separation": 6,
"band_margin": 0.1
},
"sample_count": 100,
"video_group_folds": 5,
"seeds": [
42,
3407,
2026
],
"device": "cuda",
"gpu_name": "NVIDIA GeForce RTX 5070 Ti",
"python": "3.14.7",
"torch": "2.14.0+cu130",
"elapsed_seconds": 334.72593688964844,
"probes": {
"within_clip_retrieval_tolerance_slots": 1,
"retrieval_top_k": 3,
"shuffled_reconstruction_repeats": 5,
"masked_block_ratio": 0.2
},
"limits": [
"Retrieval projections are fitted on training-fold grid-slot positives; test candidates are restricted to the same held-out clip.",
"The reconstruction control shuffles the two non-target modality slot streams and preserves the target stream.",
"No human event timestamps are available, so temporal probes do not replace manual annotation.",
"Slot-regularization losses impose weak temporal structure and must be interpreted alongside the unregularized M1/M2 reference."
]
},
{
"variant": "v2_b",
"loss_coefficients": {
"lambda_reconstruction": 1.0,
"lambda_contrastive": 1.0,
"lambda_monotonicity": 0.1,
"lambda_span": 5.0,
"lambda_diversity": 0.5,
"lambda_band": 0.0,
"coverage_floor": 0.7,
"diversity_slot_separation": 6,
"band_margin": 0.1
},
"sample_count": 100,
"video_group_folds": 5,
"seeds": [
42,
3407,
2026
],
"device": "cuda",
"gpu_name": "NVIDIA GeForce RTX 5070 Ti",
"python": "3.14.7",
"torch": "2.14.0+cu130",
"elapsed_seconds": 351.69746375083923,
"probes": {
"within_clip_retrieval_tolerance_slots": 1,
"retrieval_top_k": 3,
"shuffled_reconstruction_repeats": 5,
"masked_block_ratio": 0.2
},
"limits": [
"Retrieval projections are fitted on training-fold grid-slot positives; test candidates are restricted to the same held-out clip.",
"The reconstruction control shuffles the two non-target modality slot streams and preserves the target stream.",
"No human event timestamps are available, so temporal probes do not replace manual annotation.",
"Slot-regularization losses impose weak temporal structure and must be interpreted alongside the unregularized M1/M2 reference."
]
},
{
"variant": "v2_c",
"loss_coefficients": {
"lambda_reconstruction": 1.0,
"lambda_contrastive": 1.0,
"lambda_monotonicity": 0.1,
"lambda_span": 5.0,
"lambda_diversity": 0.5,
"lambda_band": 10.0,
"coverage_floor": 0.7,
"diversity_slot_separation": 6,
"band_margin": 0.1
},
"sample_count": 100,
"video_group_folds": 5,
"seeds": [
42,
3407,
2026
],
"device": "cuda",
"gpu_name": "NVIDIA GeForce RTX 5070 Ti",
"python": "3.14.7",
"torch": "2.14.0+cu130",
"elapsed_seconds": 360.13046407699585,
"probes": {
"within_clip_retrieval_tolerance_slots": 1,
"retrieval_top_k": 3,
"shuffled_reconstruction_repeats": 5,
"masked_block_ratio": 0.2
},
"limits": [
"Retrieval projections are fitted on training-fold grid-slot positives; test candidates are restricted to the same held-out clip.",
"The reconstruction control shuffles the two non-target modality slot streams and preserves the target stream.",
"No human event timestamps are available, so temporal probes do not replace manual annotation.",
"Slot-regularization losses impose weak temporal structure and must be interpreted alongside the unregularized M1/M2 reference."
]
}
],
"elapsed_seconds": 1086.4146564006805,
"fixed_methods_unchanged": [
"M1",
"M2"
],
"feature_extraction_changed": false
}