[start] samples=100 folds=5 seeds=[42, 3407, 2026] device=cuda variants=v2_a,v2_b,v2_c [fixed fold 1/5] train=80 validation=20; evaluating unchanged M1/M2 [fixed fold 2/5] train=80 validation=20; evaluating unchanged M1/M2 [fixed fold 3/5] train=80 validation=20; evaluating unchanged M1/M2 [fixed fold 4/5] train=80 validation=20; evaluating unchanged M1/M2 [fixed fold 5/5] train=80 validation=20; evaluating unchanged M1/M2 [v2_a fold 1/5] training M3/M4 with 80 train and 20 validation clips [v2_a fold 1] M3 seed=42 best_epoch=39 val=7.7805 C_row(audio/vision)=0.802/0.969 [v2_a fold 1] M4 seed=42 best_epoch=4 val=8.5170 C_row(audio/vision)=1.000/1.000 [v2_a fold 1] M3 seed=3407 best_epoch=45 val=7.6577 C_row(audio/vision)=0.728/0.961 [v2_a fold 1] M4 seed=3407 best_epoch=4 val=8.3070 C_row(audio/vision)=1.000/1.000 [v2_a fold 1] M3 seed=2026 best_epoch=30 val=7.8561 C_row(audio/vision)=0.855/0.987 [v2_a fold 1] M4 seed=2026 best_epoch=3 val=8.5412 C_row(audio/vision)=1.000/1.000 [v2_a fold 2/5] training M3/M4 with 80 train and 20 validation clips [v2_a fold 2] M3 seed=42 best_epoch=1 val=8.5791 C_row(audio/vision)=0.995/0.999 [v2_a fold 2] M4 seed=42 best_epoch=1 val=8.3893 C_row(audio/vision)=1.000/1.000 [v2_a fold 2] M3 seed=3407 best_epoch=29 val=8.2238 C_row(audio/vision)=0.818/0.987 [v2_a fold 2] M4 seed=3407 best_epoch=3 val=8.5151 C_row(audio/vision)=1.000/1.000 [v2_a fold 2] M3 seed=2026 best_epoch=30 val=8.0788 C_row(audio/vision)=0.793/0.988 [v2_a fold 2] M4 seed=2026 best_epoch=1 val=8.4105 C_row(audio/vision)=1.000/1.000 [v2_a fold 3/5] training M3/M4 with 80 train and 20 validation clips [v2_a fold 3] M3 seed=42 best_epoch=26 val=8.0276 C_row(audio/vision)=0.885/0.985 [v2_a fold 3] M4 seed=42 best_epoch=31 val=8.0486 C_row(audio/vision)=0.965/0.999 [v2_a fold 3] M3 seed=3407 best_epoch=25 val=8.0664 C_row(audio/vision)=0.893/0.984 [v2_a fold 3] M4 seed=3407 best_epoch=20 val=7.6810 C_row(audio/vision)=0.996/1.000 [v2_a fold 3] M3 seed=2026 best_epoch=27 val=8.0816 C_row(audio/vision)=0.836/0.979 [v2_a fold 3] M4 seed=2026 best_epoch=3 val=8.4686 C_row(audio/vision)=1.000/1.000 [v2_a fold 4/5] training M3/M4 with 80 train and 20 validation clips [v2_a fold 4] M3 seed=42 best_epoch=25 val=8.1088 C_row(audio/vision)=0.857/0.988 [v2_a fold 4] M4 seed=42 best_epoch=1 val=8.4480 C_row(audio/vision)=1.000/1.000 [v2_a fold 4] M3 seed=3407 best_epoch=29 val=8.0979 C_row(audio/vision)=0.843/0.976 [v2_a fold 4] M4 seed=3407 best_epoch=2 val=8.4787 C_row(audio/vision)=1.000/1.000 [v2_a fold 4] M3 seed=2026 best_epoch=31 val=8.1568 C_row(audio/vision)=0.823/0.985 [v2_a fold 4] M4 seed=2026 best_epoch=2 val=8.5234 C_row(audio/vision)=1.000/1.000 [v2_a fold 5/5] training M3/M4 with 80 train and 20 validation clips [v2_a fold 5] M3 seed=42 best_epoch=33 val=7.9642 C_row(audio/vision)=0.851/0.973 [v2_a fold 5] M4 seed=42 best_epoch=4 val=8.4633 C_row(audio/vision)=1.000/1.000 [v2_a fold 5] M3 seed=3407 best_epoch=36 val=7.9612 C_row(audio/vision)=0.840/0.955 [v2_a fold 5] M4 seed=3407 best_epoch=50 val=7.6178 C_row(audio/vision)=0.951/0.988 [v2_a fold 5] M3 seed=2026 best_epoch=28 val=7.9423 C_row(audio/vision)=0.890/0.973 [v2_a fold 5] M4 seed=2026 best_epoch=1 val=8.3293 C_row(audio/vision)=1.000/1.000 [v2_a done] elapsed=334.7s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2/v2_a; summary rows=48 [v2_b fold 1/5] training M3/M4 with 80 train and 20 validation clips [v2_b fold 1] M3 seed=42 best_epoch=39 val=8.2245 C_row(audio/vision)=0.746/0.963 [v2_b fold 1] M4 seed=42 best_epoch=4 val=9.0169 C_row(audio/vision)=1.000/1.000 [v2_b fold 1] M3 seed=3407 best_epoch=45 val=8.0834 C_row(audio/vision)=0.647/0.951 [v2_b fold 1] M4 seed=3407 best_epoch=4 val=8.8069 C_row(audio/vision)=1.000/1.000 [v2_b fold 1] M3 seed=2026 best_epoch=30 val=8.2653 C_row(audio/vision)=0.791/0.984 [v2_b fold 1] M4 seed=2026 best_epoch=3 val=9.0412 C_row(audio/vision)=1.000/1.000 [v2_b fold 2/5] training M3/M4 with 80 train and 20 validation clips [v2_b fold 2] M3 seed=42 best_epoch=1 val=9.0775 C_row(audio/vision)=0.995/0.999 [v2_b fold 2] M4 seed=42 best_epoch=1 val=8.8892 C_row(audio/vision)=1.000/1.000 [v2_b fold 2] M3 seed=3407 best_epoch=29 val=8.6745 C_row(audio/vision)=0.771/0.984 [v2_b fold 2] M4 seed=3407 best_epoch=34 val=8.4230 C_row(audio/vision)=0.872/0.999 [v2_b fold 2] M3 seed=2026 best_epoch=30 val=8.5185 C_row(audio/vision)=0.736/0.986 [v2_b fold 2] M4 seed=2026 best_epoch=1 val=8.9105 C_row(audio/vision)=1.000/1.000 [v2_b fold 3/5] training M3/M4 with 80 train and 20 validation clips [v2_b fold 3] M3 seed=42 best_epoch=26 val=8.4752 C_row(audio/vision)=0.843/0.983 [v2_b fold 3] M4 seed=42 best_epoch=31 val=8.4967 C_row(audio/vision)=0.950/0.999 [v2_b fold 3] M3 seed=3407 best_epoch=25 val=8.5216 C_row(audio/vision)=0.856/0.982 [v2_b fold 3] M4 seed=3407 best_epoch=28 val=8.0958 C_row(audio/vision)=0.943/0.999 [v2_b fold 3] M3 seed=2026 best_epoch=27 val=8.5222 C_row(audio/vision)=0.797/0.976 [v2_b fold 3] M4 seed=2026 best_epoch=3 val=8.9686 C_row(audio/vision)=1.000/1.000 [v2_b fold 4/5] training M3/M4 with 80 train and 20 validation clips [v2_b fold 4] M3 seed=42 best_epoch=25 val=8.5698 C_row(audio/vision)=0.814/0.986 [v2_b fold 4] M4 seed=42 best_epoch=1 val=8.9479 C_row(audio/vision)=1.000/1.000 [v2_b fold 4] M3 seed=3407 best_epoch=30 val=8.5162 C_row(audio/vision)=0.787/0.966 [v2_b fold 4] M4 seed=3407 best_epoch=2 val=8.9787 C_row(audio/vision)=1.000/1.000 [v2_b fold 4] M3 seed=2026 best_epoch=40 val=8.5877 C_row(audio/vision)=0.631/0.936 [v2_b fold 4] M4 seed=2026 best_epoch=2 val=9.0233 C_row(audio/vision)=1.000/1.000 [v2_b fold 5/5] training M3/M4 with 80 train and 20 validation clips [v2_b fold 5] M3 seed=42 best_epoch=49 val=8.3492 C_row(audio/vision)=0.659/0.836 [v2_b fold 5] M4 seed=42 best_epoch=4 val=8.9632 C_row(audio/vision)=1.000/1.000 [v2_b fold 5] M3 seed=3407 best_epoch=42 val=8.3579 C_row(audio/vision)=0.730/0.907 [v2_b fold 5] M4 seed=3407 best_epoch=28 val=8.1570 C_row(audio/vision)=0.975/1.000 [v2_b fold 5] M3 seed=2026 best_epoch=28 val=8.3718 C_row(audio/vision)=0.847/0.969 [v2_b fold 5] M4 seed=2026 best_epoch=1 val=8.8293 C_row(audio/vision)=1.000/1.000 [v2_b done] elapsed=351.7s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2/v2_b; summary rows=48 [v2_c fold 1/5] training M3/M4 with 80 train and 20 validation clips [v2_c fold 1] M3 seed=42 best_epoch=39 val=8.5597 C_row(audio/vision)=0.753/0.964 [v2_c fold 1] M4 seed=42 best_epoch=4 val=9.4480 C_row(audio/vision)=1.000/1.000 [v2_c fold 1] M3 seed=3407 best_epoch=45 val=8.4024 C_row(audio/vision)=0.652/0.951 [v2_c fold 1] M4 seed=3407 best_epoch=42 val=8.2771 C_row(audio/vision)=0.893/0.994 [v2_c fold 1] M3 seed=2026 best_epoch=30 val=8.5775 C_row(audio/vision)=0.795/0.983 [v2_c fold 1] M4 seed=2026 best_epoch=3 val=9.4722 C_row(audio/vision)=1.000/1.000 [v2_c fold 2/5] training M3/M4 with 80 train and 20 validation clips [v2_c fold 2] M3 seed=42 best_epoch=1 val=9.4566 C_row(audio/vision)=0.995/0.999 [v2_c fold 2] M4 seed=42 best_epoch=1 val=9.3218 C_row(audio/vision)=1.000/1.000 [v2_c fold 2] M3 seed=3407 best_epoch=26 val=9.0674 C_row(audio/vision)=0.800/0.991 [v2_c fold 2] M4 seed=3407 best_epoch=28 val=8.6381 C_row(audio/vision)=0.888/1.000 [v2_c fold 2] M3 seed=2026 best_epoch=30 val=8.9090 C_row(audio/vision)=0.736/0.985 [v2_c fold 2] M4 seed=2026 best_epoch=1 val=9.3429 C_row(audio/vision)=1.000/1.000 [v2_c fold 3/5] training M3/M4 with 80 train and 20 validation clips [v2_c fold 3] M3 seed=42 best_epoch=26 val=8.9050 C_row(audio/vision)=0.842/0.981 [v2_c fold 3] M4 seed=42 best_epoch=31 val=8.7508 C_row(audio/vision)=0.932/0.998 [v2_c fold 3] M3 seed=3407 best_epoch=24 val=8.9361 C_row(audio/vision)=0.862/0.984 [v2_c fold 3] M4 seed=3407 best_epoch=28 val=8.3848 C_row(audio/vision)=0.926/0.998 [v2_c fold 3] M3 seed=2026 best_epoch=26 val=8.9320 C_row(audio/vision)=0.809/0.978 [v2_c fold 3] M4 seed=2026 best_epoch=3 val=9.4028 C_row(audio/vision)=1.000/1.000 [v2_c fold 4/5] training M3/M4 with 80 train and 20 validation clips [v2_c fold 4] M3 seed=42 best_epoch=25 val=8.9781 C_row(audio/vision)=0.811/0.985 [v2_c fold 4] M4 seed=42 best_epoch=1 val=9.3892 C_row(audio/vision)=1.000/1.000 [v2_c fold 4] M3 seed=3407 best_epoch=30 val=8.9323 C_row(audio/vision)=0.780/0.964 [v2_c fold 4] M4 seed=3407 best_epoch=2 val=9.4197 C_row(audio/vision)=1.000/1.000 [v2_c fold 4] M3 seed=2026 best_epoch=39 val=8.9793 C_row(audio/vision)=0.639/0.943 [v2_c fold 4] M4 seed=2026 best_epoch=2 val=9.4643 C_row(audio/vision)=1.000/1.000 [v2_c fold 5/5] training M3/M4 with 80 train and 20 validation clips [v2_c fold 5] M3 seed=42 best_epoch=43 val=8.7819 C_row(audio/vision)=0.707/0.888 [v2_c fold 5] M4 seed=42 best_epoch=42 val=8.3535 C_row(audio/vision)=0.861/0.995 [v2_c fold 5] M3 seed=3407 best_epoch=42 val=8.7810 C_row(audio/vision)=0.730/0.903 [v2_c fold 5] M4 seed=3407 best_epoch=27 val=8.4597 C_row(audio/vision)=0.974/1.000 [v2_c fold 5] M3 seed=2026 best_epoch=28 val=8.7653 C_row(audio/vision)=0.847/0.965 [v2_c fold 5] M4 seed=2026 best_epoch=1 val=9.2652 C_row(audio/vision)=1.000/1.000 [v2_c done] elapsed=360.1s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2/v2_c; summary rows=48 [all done] elapsed=1086.4s output=/home/gloamxun/modeling_zhaocui/Q1/outputs/alignment_v2 { "created_utc": "2026-09-23T10:04:06.673162+00:00", "sample_count": 100, "group_count": 37, "folds": 5, "seeds": [ 42, 3407, 2026 ], "device": "cuda", "gpu_name": "NVIDIA GeForce RTX 5070 Ti", "python": "3.14.7", "torch": "2.14.0+cu130", "feature_dir": "/home/gloamxun/modeling_zhaocui/Q1/outputs/q1_features/features", "baseline_dir": "/home/gloamxun/modeling_zhaocui/Q1/outputs/method_comparison", "variants": [ { "variant": "v2_a", "loss_coefficients": { "lambda_reconstruction": 1.0, "lambda_contrastive": 1.0, "lambda_monotonicity": 0.1, "lambda_span": 5.0, "lambda_diversity": 0.0, "lambda_band": 0.0, "coverage_floor": 0.7, "diversity_slot_separation": 6, "band_margin": 0.1 }, "sample_count": 100, "video_group_folds": 5, "seeds": [ 42, 3407, 2026 ], "device": "cuda", "gpu_name": "NVIDIA GeForce RTX 5070 Ti", "python": "3.14.7", "torch": "2.14.0+cu130", "elapsed_seconds": 334.72593688964844, "probes": { "within_clip_retrieval_tolerance_slots": 1, "retrieval_top_k": 3, "shuffled_reconstruction_repeats": 5, "masked_block_ratio": 0.2 }, "limits": [ "Retrieval projections are fitted on training-fold grid-slot positives; test candidates are restricted to the same held-out clip.", "The reconstruction control shuffles the two non-target modality slot streams and preserves the target stream.", "No human event timestamps are available, so temporal probes do not replace manual annotation.", "Slot-regularization losses impose weak temporal structure and must be interpreted alongside the unregularized M1/M2 reference." ] }, { "variant": "v2_b", "loss_coefficients": { "lambda_reconstruction": 1.0, "lambda_contrastive": 1.0, "lambda_monotonicity": 0.1, "lambda_span": 5.0, "lambda_diversity": 0.5, "lambda_band": 0.0, "coverage_floor": 0.7, "diversity_slot_separation": 6, "band_margin": 0.1 }, "sample_count": 100, "video_group_folds": 5, "seeds": [ 42, 3407, 2026 ], "device": "cuda", "gpu_name": "NVIDIA GeForce RTX 5070 Ti", "python": "3.14.7", "torch": "2.14.0+cu130", "elapsed_seconds": 351.69746375083923, "probes": { "within_clip_retrieval_tolerance_slots": 1, "retrieval_top_k": 3, "shuffled_reconstruction_repeats": 5, "masked_block_ratio": 0.2 }, "limits": [ "Retrieval projections are fitted on training-fold grid-slot positives; test candidates are restricted to the same held-out clip.", "The reconstruction control shuffles the two non-target modality slot streams and preserves the target stream.", "No human event timestamps are available, so temporal probes do not replace manual annotation.", "Slot-regularization losses impose weak temporal structure and must be interpreted alongside the unregularized M1/M2 reference." ] }, { "variant": "v2_c", "loss_coefficients": { "lambda_reconstruction": 1.0, "lambda_contrastive": 1.0, "lambda_monotonicity": 0.1, "lambda_span": 5.0, "lambda_diversity": 0.5, "lambda_band": 10.0, "coverage_floor": 0.7, "diversity_slot_separation": 6, "band_margin": 0.1 }, "sample_count": 100, "video_group_folds": 5, "seeds": [ 42, 3407, 2026 ], "device": "cuda", "gpu_name": "NVIDIA GeForce RTX 5070 Ti", "python": "3.14.7", "torch": "2.14.0+cu130", "elapsed_seconds": 360.13046407699585, "probes": { "within_clip_retrieval_tolerance_slots": 1, "retrieval_top_k": 3, "shuffled_reconstruction_repeats": 5, "masked_block_ratio": 0.2 }, "limits": [ "Retrieval projections are fitted on training-fold grid-slot positives; test candidates are restricted to the same held-out clip.", "The reconstruction control shuffles the two non-target modality slot streams and preserves the target stream.", "No human event timestamps are available, so temporal probes do not replace manual annotation.", "Slot-regularization losses impose weak temporal structure and must be interpreted alongside the unregularized M1/M2 reference." ] } ], "elapsed_seconds": 1086.4146564006805, "fixed_methods_unchanged": [ "M1", "M2" ], "feature_extraction_changed": false }