Yaswanth-Bolla commited on
Commit
1292003
·
verified ·
1 Parent(s): 529edc0

eval_compare: upload findings run 20260426_083700

Browse files
findings/20260426_083700/calibration.png ADDED
findings/20260426_083700/comparison_tables.md ADDED
@@ -0,0 +1,46 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # Model Comparison: fine-tuned vs base Qwen2.5-7B
2
+
3
+ - **Fine-tuned** : `Yaswanth-Bolla/qwen-merged`
4
+ - **Base** : `Qwen/Qwen2.5-7B-Instruct`
5
+
6
+ ## Claim 1 — Orchestrator stopping behaviour (Pool C)
7
+
8
+ | Metric | fine-tuned | base | Δ (fine − base) |
9
+ | --- | --- | --- | --- |
10
+ | mean_final | 0.4537 | 0.4495 | ▲ 0.0042 |
11
+ | mean_p1_steps | 15.75 | 16.62 | ▼ 0.87 |
12
+ | mean_p2_steps | 6.5 | 5.62 | ▲ 0.88 |
13
+ | mean_r_cross | 0.4662 | 0.4412 | ▲ 0.025 |
14
+ | ECE | 0.8125 | 0.5813 | ▲ 0.2312 |
15
+ | stopping_distribution (histogram) | see JSON | see JSON | — |
16
+
17
+ ## Claim 2 — r_cross ablation (Pool C)
18
+
19
+ | Condition | Metric | fine-tuned | base | Δ |
20
+ | --- | --- | --- | --- | --- |
21
+ | r_cross_on | mean_final | 0.4994 | 0.4738 | ▲ 0.0256 |
22
+ | r_cross_on | mean_r_cross | 0.585 | 0.4163 | ▲ 0.1687 |
23
+ | r_cross_on | p2_steps_to_correct_patch | 6.86 | 5.86 | ▲ 1.0 |
24
+ | r_cross_off | mean_final | 0.4867 | 0.4813 | ▲ 0.0054 |
25
+ | r_cross_off | mean_r_cross | 0.0 | 0.0 | = 0.0 |
26
+ | r_cross_off | p2_steps_to_correct_patch | 7.29 | 4.29 | ▲ 3.0 |
27
+
28
+ ## Claim 3 — Convergence proxy (Pool C)
29
+
30
+ | Metric | fine-tuned | base | Δ |
31
+ | --- | --- | --- | --- |
32
+ | mean_final | 0.4675 | 0.4798 | ▼ 0.0123 |
33
+ | stdev_final | 0.2184 | 0.2201 | ▼ 0.0017 |
34
+
35
+ **fine-tuned convergence curve**: [0.7475, 0.4255]
36
+
37
+ **base convergence curve**: [0.6425, 0.462]
38
+
39
+ ## Claim 4 — Held-out generalization (Pool D)
40
+
41
+ | Metric | fine-tuned | base | Δ |
42
+ | --- | --- | --- | --- |
43
+ | mean_final | 0.5284 | 0.5565 | ▼ 0.0281 |
44
+ | stdev_final | 0.071 | 0.0696 | ▲ 0.0014 |
45
+ | ECE | 0.925 | 0.8187 | ▲ 0.1063 |
46
+ | pearson_r (P2 breadth) | -0.3637 | 0.4951 | ▼ 0.8588 |
findings/20260426_083700/convergence.png ADDED
findings/20260426_083700/manifest.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "outdir": "eval_output",
3
+ "files": {
4
+ "results_finetuned": "eval_output/results_Yaswanth-Bolla_qwen-merged.json",
5
+ "results_base": "eval_output/results_Qwen_Qwen2.5-7B-Instruct.json",
6
+ "comparison_tables": "eval_output/comparison_tables.md",
7
+ "plots": [
8
+ "eval_output/mean_final_comparison.png",
9
+ "eval_output/stopping_distribution.png",
10
+ "eval_output/calibration.png",
11
+ "eval_output/convergence.png"
12
+ ]
13
+ }
14
+ }
findings/20260426_083700/mean_final_comparison.png ADDED
findings/20260426_083700/results_Qwen_Qwen2.5-7B-Instruct.json ADDED
@@ -0,0 +1,506 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "claim1": {
3
+ "claim": "1_orchestrator_stopping",
4
+ "n": 8,
5
+ "aggregate": {
6
+ "n": 8,
7
+ "mean_final": 0.4495,
8
+ "stdev_final": 0.1976,
9
+ "mean_r_cross": 0.4412,
10
+ "mean_p1_steps": 16.62,
11
+ "mean_p2_steps": 5.62
12
+ },
13
+ "behavioral": {
14
+ "stopping_distribution": {
15
+ "model": {
16
+ "[0,4)": 9.999920000639996e-07,
17
+ "[4,6)": 9.999920000639996e-07,
18
+ "[6,8)": 0.24999900000799996,
19
+ "[8,10)": 9.999920000639996e-07,
20
+ "[10,13)": 9.999920000639996e-07,
21
+ "[13,17)": 0.24999900000799996,
22
+ "[17,25)": 0.24999900000799996,
23
+ "[25,inf)": 0.24999900000799996
24
+ },
25
+ "kl_pairwise": {}
26
+ },
27
+ "action_position[check_dependencies]": {
28
+ "model": {
29
+ "frequency": 1.0,
30
+ "mean_position": 3.12,
31
+ "median_position": 3.0,
32
+ "n": 8
33
+ }
34
+ },
35
+ "confidence_calibration": {
36
+ "model": {
37
+ "ece": 0.5813,
38
+ "buckets": [
39
+ {
40
+ "bucket_low": 0.0,
41
+ "bucket_high": 0.1,
42
+ "n": 2,
43
+ "mean_conf": 0.0,
44
+ "accuracy": 0.0
45
+ },
46
+ {
47
+ "bucket_low": 0.1,
48
+ "bucket_high": 0.2,
49
+ "n": 0,
50
+ "mean_conf": 0.0,
51
+ "accuracy": 0.0
52
+ },
53
+ {
54
+ "bucket_low": 0.2,
55
+ "bucket_high": 0.3,
56
+ "n": 0,
57
+ "mean_conf": 0.0,
58
+ "accuracy": 0.0
59
+ },
60
+ {
61
+ "bucket_low": 0.3,
62
+ "bucket_high": 0.4,
63
+ "n": 0,
64
+ "mean_conf": 0.0,
65
+ "accuracy": 0.0
66
+ },
67
+ {
68
+ "bucket_low": 0.4,
69
+ "bucket_high": 0.5,
70
+ "n": 0,
71
+ "mean_conf": 0.0,
72
+ "accuracy": 0.0
73
+ },
74
+ {
75
+ "bucket_low": 0.5,
76
+ "bucket_high": 0.6,
77
+ "n": 0,
78
+ "mean_conf": 0.0,
79
+ "accuracy": 0.0
80
+ },
81
+ {
82
+ "bucket_low": 0.6,
83
+ "bucket_high": 0.7,
84
+ "n": 0,
85
+ "mean_conf": 0.0,
86
+ "accuracy": 0.0
87
+ },
88
+ {
89
+ "bucket_low": 0.7,
90
+ "bucket_high": 0.8,
91
+ "n": 0,
92
+ "mean_conf": 0.0,
93
+ "accuracy": 0.0
94
+ },
95
+ {
96
+ "bucket_low": 0.8,
97
+ "bucket_high": 0.9,
98
+ "n": 0,
99
+ "mean_conf": 0.0,
100
+ "accuracy": 0.0
101
+ },
102
+ {
103
+ "bucket_low": 0.9,
104
+ "bucket_high": 1.0,
105
+ "n": 6,
106
+ "mean_conf": 0.942,
107
+ "accuracy": 0.167
108
+ }
109
+ ],
110
+ "n": 8
111
+ }
112
+ },
113
+ "p2_search_breadth_correlation": {
114
+ "model": {
115
+ "pearson_r": 0.0,
116
+ "n": 6
117
+ }
118
+ },
119
+ "n_episodes_per_condition": {
120
+ "model": 8
121
+ },
122
+ "n_total": 8
123
+ }
124
+ },
125
+ "claim2": {
126
+ "claim": "2_r_cross_ablation",
127
+ "n_per_condition": 8,
128
+ "aggregate": {
129
+ "r_cross_on": {
130
+ "n": 8,
131
+ "mean_final": 0.4738,
132
+ "stdev_final": 0.179,
133
+ "mean_r_cross": 0.4163,
134
+ "mean_p1_steps": 15.75,
135
+ "mean_p2_steps": 6.12,
136
+ "p2_steps_to_correct_patch": 5.86
137
+ },
138
+ "r_cross_off": {
139
+ "n": 8,
140
+ "mean_final": 0.4813,
141
+ "stdev_final": 0.183,
142
+ "mean_r_cross": 0.0,
143
+ "mean_p1_steps": 18,
144
+ "mean_p2_steps": 4.75,
145
+ "p2_steps_to_correct_patch": 4.29
146
+ }
147
+ },
148
+ "behavioral": {
149
+ "stopping_distribution": {
150
+ "r_cross_on": {
151
+ "[0,4)": 9.999920000639994e-07,
152
+ "[4,6)": 9.999920000639994e-07,
153
+ "[6,8)": 0.2499990000079999,
154
+ "[8,10)": 0.125,
155
+ "[10,13)": 9.999920000639994e-07,
156
+ "[13,17)": 9.999920000639994e-07,
157
+ "[17,25)": 0.6249960000319997,
158
+ "[25,inf)": 9.999920000639994e-07
159
+ },
160
+ "r_cross_off": {
161
+ "[0,4)": 9.999920000639994e-07,
162
+ "[4,6)": 9.999920000639994e-07,
163
+ "[6,8)": 9.999920000639994e-07,
164
+ "[8,10)": 0.2499990000079999,
165
+ "[10,13)": 9.999920000639994e-07,
166
+ "[13,17)": 9.999920000639994e-07,
167
+ "[17,25)": 0.6249960000319997,
168
+ "[25,inf)": 0.125
169
+ },
170
+ "kl_pairwise": {
171
+ "r_cross_on_vs_r_cross_off": 3.0206
172
+ }
173
+ },
174
+ "action_position[check_dependencies]": {
175
+ "r_cross_on": {
176
+ "frequency": 1.0,
177
+ "mean_position": 3,
178
+ "median_position": 3.0,
179
+ "n": 8
180
+ },
181
+ "r_cross_off": {
182
+ "frequency": 1.0,
183
+ "mean_position": 2.5,
184
+ "median_position": 2.0,
185
+ "n": 8
186
+ }
187
+ },
188
+ "confidence_calibration": {
189
+ "r_cross_on": {
190
+ "ece": 0.8063,
191
+ "buckets": [
192
+ {
193
+ "bucket_low": 0.0,
194
+ "bucket_high": 0.1,
195
+ "n": 0,
196
+ "mean_conf": 0.0,
197
+ "accuracy": 0.0
198
+ },
199
+ {
200
+ "bucket_low": 0.1,
201
+ "bucket_high": 0.2,
202
+ "n": 0,
203
+ "mean_conf": 0.0,
204
+ "accuracy": 0.0
205
+ },
206
+ {
207
+ "bucket_low": 0.2,
208
+ "bucket_high": 0.3,
209
+ "n": 0,
210
+ "mean_conf": 0.0,
211
+ "accuracy": 0.0
212
+ },
213
+ {
214
+ "bucket_low": 0.3,
215
+ "bucket_high": 0.4,
216
+ "n": 0,
217
+ "mean_conf": 0.0,
218
+ "accuracy": 0.0
219
+ },
220
+ {
221
+ "bucket_low": 0.4,
222
+ "bucket_high": 0.5,
223
+ "n": 0,
224
+ "mean_conf": 0.0,
225
+ "accuracy": 0.0
226
+ },
227
+ {
228
+ "bucket_low": 0.5,
229
+ "bucket_high": 0.6,
230
+ "n": 0,
231
+ "mean_conf": 0.0,
232
+ "accuracy": 0.0
233
+ },
234
+ {
235
+ "bucket_low": 0.6,
236
+ "bucket_high": 0.7,
237
+ "n": 0,
238
+ "mean_conf": 0.0,
239
+ "accuracy": 0.0
240
+ },
241
+ {
242
+ "bucket_low": 0.7,
243
+ "bucket_high": 0.8,
244
+ "n": 0,
245
+ "mean_conf": 0.0,
246
+ "accuracy": 0.0
247
+ },
248
+ {
249
+ "bucket_low": 0.8,
250
+ "bucket_high": 0.9,
251
+ "n": 1,
252
+ "mean_conf": 0.85,
253
+ "accuracy": 0.0
254
+ },
255
+ {
256
+ "bucket_low": 0.9,
257
+ "bucket_high": 1.0,
258
+ "n": 7,
259
+ "mean_conf": 0.943,
260
+ "accuracy": 0.143
261
+ }
262
+ ],
263
+ "n": 8
264
+ },
265
+ "r_cross_off": {
266
+ "ece": 0.8125,
267
+ "buckets": [
268
+ {
269
+ "bucket_low": 0.0,
270
+ "bucket_high": 0.1,
271
+ "n": 1,
272
+ "mean_conf": 0.0,
273
+ "accuracy": 0.0
274
+ },
275
+ {
276
+ "bucket_low": 0.1,
277
+ "bucket_high": 0.2,
278
+ "n": 0,
279
+ "mean_conf": 0.0,
280
+ "accuracy": 0.0
281
+ },
282
+ {
283
+ "bucket_low": 0.2,
284
+ "bucket_high": 0.3,
285
+ "n": 0,
286
+ "mean_conf": 0.0,
287
+ "accuracy": 0.0
288
+ },
289
+ {
290
+ "bucket_low": 0.3,
291
+ "bucket_high": 0.4,
292
+ "n": 0,
293
+ "mean_conf": 0.0,
294
+ "accuracy": 0.0
295
+ },
296
+ {
297
+ "bucket_low": 0.4,
298
+ "bucket_high": 0.5,
299
+ "n": 0,
300
+ "mean_conf": 0.0,
301
+ "accuracy": 0.0
302
+ },
303
+ {
304
+ "bucket_low": 0.5,
305
+ "bucket_high": 0.6,
306
+ "n": 0,
307
+ "mean_conf": 0.0,
308
+ "accuracy": 0.0
309
+ },
310
+ {
311
+ "bucket_low": 0.6,
312
+ "bucket_high": 0.7,
313
+ "n": 0,
314
+ "mean_conf": 0.0,
315
+ "accuracy": 0.0
316
+ },
317
+ {
318
+ "bucket_low": 0.7,
319
+ "bucket_high": 0.8,
320
+ "n": 0,
321
+ "mean_conf": 0.0,
322
+ "accuracy": 0.0
323
+ },
324
+ {
325
+ "bucket_low": 0.8,
326
+ "bucket_high": 0.9,
327
+ "n": 1,
328
+ "mean_conf": 0.85,
329
+ "accuracy": 0.0
330
+ },
331
+ {
332
+ "bucket_low": 0.9,
333
+ "bucket_high": 1.0,
334
+ "n": 6,
335
+ "mean_conf": 0.942,
336
+ "accuracy": 0.0
337
+ }
338
+ ],
339
+ "n": 8
340
+ }
341
+ },
342
+ "p2_search_breadth_correlation": {
343
+ "r_cross_on": {
344
+ "pearson_r": -0.3637,
345
+ "n": 8,
346
+ "mean_breadth": 2.75,
347
+ "mean_confidence": 0.888
348
+ },
349
+ "r_cross_off": {
350
+ "pearson_r": -0.0747,
351
+ "n": 7,
352
+ "mean_breadth": 2.86,
353
+ "mean_confidence": 0.879
354
+ }
355
+ },
356
+ "n_episodes_per_condition": {
357
+ "r_cross_on": 8,
358
+ "r_cross_off": 8
359
+ },
360
+ "n_total": 16
361
+ }
362
+ },
363
+ "claim3": {
364
+ "claim": "3_convergence_proxy",
365
+ "n": 8,
366
+ "aggregate": {
367
+ "n": 8,
368
+ "mean_final": 0.4798,
369
+ "stdev_final": 0.2201,
370
+ "mean_r_cross": 0.4912,
371
+ "mean_p1_steps": 15.5,
372
+ "mean_p2_steps": 6.5
373
+ },
374
+ "convergence_curve": {
375
+ "model": [
376
+ 0.6425,
377
+ 0.462
378
+ ]
379
+ }
380
+ },
381
+ "claim4": {
382
+ "claim": "4_held_out_generalization",
383
+ "n": 8,
384
+ "aggregate": {
385
+ "n": 8,
386
+ "mean_final": 0.5565,
387
+ "stdev_final": 0.0696,
388
+ "mean_r_cross": 0.4875,
389
+ "mean_p1_steps": 11.75,
390
+ "mean_p2_steps": 7.38
391
+ },
392
+ "behavioral": {
393
+ "stopping_distribution": {
394
+ "model": {
395
+ "[0,4)": 9.999920000639994e-07,
396
+ "[4,6)": 9.999920000639994e-07,
397
+ "[6,8)": 0.4999970000239998,
398
+ "[8,10)": 0.125,
399
+ "[10,13)": 9.999920000639994e-07,
400
+ "[13,17)": 0.125,
401
+ "[17,25)": 0.125,
402
+ "[25,inf)": 0.125
403
+ },
404
+ "kl_pairwise": {}
405
+ },
406
+ "action_position[check_dependencies]": {
407
+ "model": {
408
+ "frequency": 1.0,
409
+ "mean_position": 2,
410
+ "median_position": 2.0,
411
+ "n": 8
412
+ }
413
+ },
414
+ "confidence_calibration": {
415
+ "model": {
416
+ "ece": 0.8187,
417
+ "buckets": [
418
+ {
419
+ "bucket_low": 0.0,
420
+ "bucket_high": 0.1,
421
+ "n": 1,
422
+ "mean_conf": 0.0,
423
+ "accuracy": 0.0
424
+ },
425
+ {
426
+ "bucket_low": 0.1,
427
+ "bucket_high": 0.2,
428
+ "n": 0,
429
+ "mean_conf": 0.0,
430
+ "accuracy": 0.0
431
+ },
432
+ {
433
+ "bucket_low": 0.2,
434
+ "bucket_high": 0.3,
435
+ "n": 0,
436
+ "mean_conf": 0.0,
437
+ "accuracy": 0.0
438
+ },
439
+ {
440
+ "bucket_low": 0.3,
441
+ "bucket_high": 0.4,
442
+ "n": 0,
443
+ "mean_conf": 0.0,
444
+ "accuracy": 0.0
445
+ },
446
+ {
447
+ "bucket_low": 0.4,
448
+ "bucket_high": 0.5,
449
+ "n": 0,
450
+ "mean_conf": 0.0,
451
+ "accuracy": 0.0
452
+ },
453
+ {
454
+ "bucket_low": 0.5,
455
+ "bucket_high": 0.6,
456
+ "n": 0,
457
+ "mean_conf": 0.0,
458
+ "accuracy": 0.0
459
+ },
460
+ {
461
+ "bucket_low": 0.6,
462
+ "bucket_high": 0.7,
463
+ "n": 0,
464
+ "mean_conf": 0.0,
465
+ "accuracy": 0.0
466
+ },
467
+ {
468
+ "bucket_low": 0.7,
469
+ "bucket_high": 0.8,
470
+ "n": 0,
471
+ "mean_conf": 0.0,
472
+ "accuracy": 0.0
473
+ },
474
+ {
475
+ "bucket_low": 0.8,
476
+ "bucket_high": 0.9,
477
+ "n": 1,
478
+ "mean_conf": 0.85,
479
+ "accuracy": 0.0
480
+ },
481
+ {
482
+ "bucket_low": 0.9,
483
+ "bucket_high": 1.0,
484
+ "n": 6,
485
+ "mean_conf": 0.95,
486
+ "accuracy": 0.0
487
+ }
488
+ ],
489
+ "n": 8
490
+ }
491
+ },
492
+ "p2_search_breadth_correlation": {
493
+ "model": {
494
+ "pearson_r": 0.4951,
495
+ "n": 7,
496
+ "mean_breadth": 3.43,
497
+ "mean_confidence": 0.886
498
+ }
499
+ },
500
+ "n_episodes_per_condition": {
501
+ "model": 8
502
+ },
503
+ "n_total": 8
504
+ }
505
+ }
506
+ }
findings/20260426_083700/results_Yaswanth-Bolla_qwen-merged.json ADDED
@@ -0,0 +1,506 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "claim1": {
3
+ "claim": "1_orchestrator_stopping",
4
+ "n": 8,
5
+ "aggregate": {
6
+ "n": 8,
7
+ "mean_final": 0.4537,
8
+ "stdev_final": 0.1904,
9
+ "mean_r_cross": 0.4662,
10
+ "mean_p1_steps": 15.75,
11
+ "mean_p2_steps": 6.5
12
+ },
13
+ "behavioral": {
14
+ "stopping_distribution": {
15
+ "model": {
16
+ "[0,4)": 9.999920000639994e-07,
17
+ "[4,6)": 9.999920000639994e-07,
18
+ "[6,8)": 0.2499990000079999,
19
+ "[8,10)": 9.999920000639994e-07,
20
+ "[10,13)": 9.999920000639994e-07,
21
+ "[13,17)": 0.125,
22
+ "[17,25)": 0.6249960000319997,
23
+ "[25,inf)": 9.999920000639994e-07
24
+ },
25
+ "kl_pairwise": {}
26
+ },
27
+ "action_position[check_dependencies]": {
28
+ "model": {
29
+ "frequency": 1.0,
30
+ "mean_position": 2.75,
31
+ "median_position": 2.5,
32
+ "n": 8
33
+ }
34
+ },
35
+ "confidence_calibration": {
36
+ "model": {
37
+ "ece": 0.8125,
38
+ "buckets": [
39
+ {
40
+ "bucket_low": 0.0,
41
+ "bucket_high": 0.1,
42
+ "n": 0,
43
+ "mean_conf": 0.0,
44
+ "accuracy": 0.0
45
+ },
46
+ {
47
+ "bucket_low": 0.1,
48
+ "bucket_high": 0.2,
49
+ "n": 0,
50
+ "mean_conf": 0.0,
51
+ "accuracy": 0.0
52
+ },
53
+ {
54
+ "bucket_low": 0.2,
55
+ "bucket_high": 0.3,
56
+ "n": 0,
57
+ "mean_conf": 0.0,
58
+ "accuracy": 0.0
59
+ },
60
+ {
61
+ "bucket_low": 0.3,
62
+ "bucket_high": 0.4,
63
+ "n": 0,
64
+ "mean_conf": 0.0,
65
+ "accuracy": 0.0
66
+ },
67
+ {
68
+ "bucket_low": 0.4,
69
+ "bucket_high": 0.5,
70
+ "n": 0,
71
+ "mean_conf": 0.0,
72
+ "accuracy": 0.0
73
+ },
74
+ {
75
+ "bucket_low": 0.5,
76
+ "bucket_high": 0.6,
77
+ "n": 0,
78
+ "mean_conf": 0.0,
79
+ "accuracy": 0.0
80
+ },
81
+ {
82
+ "bucket_low": 0.6,
83
+ "bucket_high": 0.7,
84
+ "n": 0,
85
+ "mean_conf": 0.0,
86
+ "accuracy": 0.0
87
+ },
88
+ {
89
+ "bucket_low": 0.7,
90
+ "bucket_high": 0.8,
91
+ "n": 0,
92
+ "mean_conf": 0.0,
93
+ "accuracy": 0.0
94
+ },
95
+ {
96
+ "bucket_low": 0.8,
97
+ "bucket_high": 0.9,
98
+ "n": 0,
99
+ "mean_conf": 0.0,
100
+ "accuracy": 0.0
101
+ },
102
+ {
103
+ "bucket_low": 0.9,
104
+ "bucket_high": 1.0,
105
+ "n": 8,
106
+ "mean_conf": 0.938,
107
+ "accuracy": 0.125
108
+ }
109
+ ],
110
+ "n": 8
111
+ }
112
+ },
113
+ "p2_search_breadth_correlation": {
114
+ "model": {
115
+ "pearson_r": -0.4211,
116
+ "n": 8,
117
+ "mean_breadth": 2.62,
118
+ "mean_confidence": 0.912
119
+ }
120
+ },
121
+ "n_episodes_per_condition": {
122
+ "model": 8
123
+ },
124
+ "n_total": 8
125
+ }
126
+ },
127
+ "claim2": {
128
+ "claim": "2_r_cross_ablation",
129
+ "n_per_condition": 8,
130
+ "aggregate": {
131
+ "r_cross_on": {
132
+ "n": 8,
133
+ "mean_final": 0.4994,
134
+ "stdev_final": 0.1266,
135
+ "mean_r_cross": 0.585,
136
+ "mean_p1_steps": 13,
137
+ "mean_p2_steps": 7.25,
138
+ "p2_steps_to_correct_patch": 6.86
139
+ },
140
+ "r_cross_off": {
141
+ "n": 8,
142
+ "mean_final": 0.4867,
143
+ "stdev_final": 0.2132,
144
+ "mean_r_cross": 0.0,
145
+ "mean_p1_steps": 13,
146
+ "mean_p2_steps": 6.38,
147
+ "p2_steps_to_correct_patch": 7.29
148
+ }
149
+ },
150
+ "behavioral": {
151
+ "stopping_distribution": {
152
+ "r_cross_on": {
153
+ "[0,4)": 9.999920000639994e-07,
154
+ "[4,6)": 9.999920000639994e-07,
155
+ "[6,8)": 0.2499990000079999,
156
+ "[8,10)": 0.125,
157
+ "[10,13)": 0.2499990000079999,
158
+ "[13,17)": 0.125,
159
+ "[17,25)": 0.125,
160
+ "[25,inf)": 0.125
161
+ },
162
+ "r_cross_off": {
163
+ "[0,4)": 9.999920000639994e-07,
164
+ "[4,6)": 9.999920000639994e-07,
165
+ "[6,8)": 0.4999970000239998,
166
+ "[8,10)": 0.125,
167
+ "[10,13)": 9.999920000639994e-07,
168
+ "[13,17)": 9.999920000639994e-07,
169
+ "[17,25)": 0.2499990000079999,
170
+ "[25,inf)": 0.125
171
+ },
172
+ "kl_pairwise": {
173
+ "r_cross_on_vs_r_cross_off": 4.3144
174
+ }
175
+ },
176
+ "action_position[check_dependencies]": {
177
+ "r_cross_on": {
178
+ "frequency": 1.0,
179
+ "mean_position": 2.75,
180
+ "median_position": 3.0,
181
+ "n": 8
182
+ },
183
+ "r_cross_off": {
184
+ "frequency": 1.0,
185
+ "mean_position": 2.5,
186
+ "median_position": 2.5,
187
+ "n": 8
188
+ }
189
+ },
190
+ "confidence_calibration": {
191
+ "r_cross_on": {
192
+ "ece": 0.8312,
193
+ "buckets": [
194
+ {
195
+ "bucket_low": 0.0,
196
+ "bucket_high": 0.1,
197
+ "n": 1,
198
+ "mean_conf": 0.0,
199
+ "accuracy": 0.0
200
+ },
201
+ {
202
+ "bucket_low": 0.1,
203
+ "bucket_high": 0.2,
204
+ "n": 0,
205
+ "mean_conf": 0.0,
206
+ "accuracy": 0.0
207
+ },
208
+ {
209
+ "bucket_low": 0.2,
210
+ "bucket_high": 0.3,
211
+ "n": 0,
212
+ "mean_conf": 0.0,
213
+ "accuracy": 0.0
214
+ },
215
+ {
216
+ "bucket_low": 0.3,
217
+ "bucket_high": 0.4,
218
+ "n": 0,
219
+ "mean_conf": 0.0,
220
+ "accuracy": 0.0
221
+ },
222
+ {
223
+ "bucket_low": 0.4,
224
+ "bucket_high": 0.5,
225
+ "n": 0,
226
+ "mean_conf": 0.0,
227
+ "accuracy": 0.0
228
+ },
229
+ {
230
+ "bucket_low": 0.5,
231
+ "bucket_high": 0.6,
232
+ "n": 0,
233
+ "mean_conf": 0.0,
234
+ "accuracy": 0.0
235
+ },
236
+ {
237
+ "bucket_low": 0.6,
238
+ "bucket_high": 0.7,
239
+ "n": 0,
240
+ "mean_conf": 0.0,
241
+ "accuracy": 0.0
242
+ },
243
+ {
244
+ "bucket_low": 0.7,
245
+ "bucket_high": 0.8,
246
+ "n": 0,
247
+ "mean_conf": 0.0,
248
+ "accuracy": 0.0
249
+ },
250
+ {
251
+ "bucket_low": 0.8,
252
+ "bucket_high": 0.9,
253
+ "n": 0,
254
+ "mean_conf": 0.0,
255
+ "accuracy": 0.0
256
+ },
257
+ {
258
+ "bucket_low": 0.9,
259
+ "bucket_high": 1.0,
260
+ "n": 7,
261
+ "mean_conf": 0.95,
262
+ "accuracy": 0.0
263
+ }
264
+ ],
265
+ "n": 8
266
+ },
267
+ "r_cross_off": {
268
+ "ece": 0.6875,
269
+ "buckets": [
270
+ {
271
+ "bucket_low": 0.0,
272
+ "bucket_high": 0.1,
273
+ "n": 1,
274
+ "mean_conf": 0.0,
275
+ "accuracy": 0.0
276
+ },
277
+ {
278
+ "bucket_low": 0.1,
279
+ "bucket_high": 0.2,
280
+ "n": 0,
281
+ "mean_conf": 0.0,
282
+ "accuracy": 0.0
283
+ },
284
+ {
285
+ "bucket_low": 0.2,
286
+ "bucket_high": 0.3,
287
+ "n": 0,
288
+ "mean_conf": 0.0,
289
+ "accuracy": 0.0
290
+ },
291
+ {
292
+ "bucket_low": 0.3,
293
+ "bucket_high": 0.4,
294
+ "n": 0,
295
+ "mean_conf": 0.0,
296
+ "accuracy": 0.0
297
+ },
298
+ {
299
+ "bucket_low": 0.4,
300
+ "bucket_high": 0.5,
301
+ "n": 0,
302
+ "mean_conf": 0.0,
303
+ "accuracy": 0.0
304
+ },
305
+ {
306
+ "bucket_low": 0.5,
307
+ "bucket_high": 0.6,
308
+ "n": 0,
309
+ "mean_conf": 0.0,
310
+ "accuracy": 0.0
311
+ },
312
+ {
313
+ "bucket_low": 0.6,
314
+ "bucket_high": 0.7,
315
+ "n": 0,
316
+ "mean_conf": 0.0,
317
+ "accuracy": 0.0
318
+ },
319
+ {
320
+ "bucket_low": 0.7,
321
+ "bucket_high": 0.8,
322
+ "n": 0,
323
+ "mean_conf": 0.0,
324
+ "accuracy": 0.0
325
+ },
326
+ {
327
+ "bucket_low": 0.8,
328
+ "bucket_high": 0.9,
329
+ "n": 1,
330
+ "mean_conf": 0.85,
331
+ "accuracy": 0.0
332
+ },
333
+ {
334
+ "bucket_low": 0.9,
335
+ "bucket_high": 1.0,
336
+ "n": 6,
337
+ "mean_conf": 0.942,
338
+ "accuracy": 0.167
339
+ }
340
+ ],
341
+ "n": 8
342
+ }
343
+ },
344
+ "p2_search_breadth_correlation": {
345
+ "r_cross_on": {
346
+ "pearson_r": 0.0,
347
+ "n": 7
348
+ },
349
+ "r_cross_off": {
350
+ "pearson_r": -0.0202,
351
+ "n": 7,
352
+ "mean_breadth": 3.29,
353
+ "mean_confidence": 0.879
354
+ }
355
+ },
356
+ "n_episodes_per_condition": {
357
+ "r_cross_on": 8,
358
+ "r_cross_off": 8
359
+ },
360
+ "n_total": 16
361
+ }
362
+ },
363
+ "claim3": {
364
+ "claim": "3_convergence_proxy",
365
+ "n": 8,
366
+ "aggregate": {
367
+ "n": 8,
368
+ "mean_final": 0.4675,
369
+ "stdev_final": 0.2184,
370
+ "mean_r_cross": 0.4662,
371
+ "mean_p1_steps": 17.38,
372
+ "mean_p2_steps": 4.88
373
+ },
374
+ "convergence_curve": {
375
+ "model": [
376
+ 0.7475,
377
+ 0.4255
378
+ ]
379
+ }
380
+ },
381
+ "claim4": {
382
+ "claim": "4_held_out_generalization",
383
+ "n": 8,
384
+ "aggregate": {
385
+ "n": 8,
386
+ "mean_final": 0.5284,
387
+ "stdev_final": 0.071,
388
+ "mean_r_cross": 0.5,
389
+ "mean_p1_steps": 17.88,
390
+ "mean_p2_steps": 5.25
391
+ },
392
+ "behavioral": {
393
+ "stopping_distribution": {
394
+ "model": {
395
+ "[0,4)": 9.999920000639994e-07,
396
+ "[4,6)": 9.999920000639994e-07,
397
+ "[6,8)": 0.125,
398
+ "[8,10)": 9.999920000639994e-07,
399
+ "[10,13)": 9.999920000639994e-07,
400
+ "[13,17)": 0.125,
401
+ "[17,25)": 0.7499950000399997,
402
+ "[25,inf)": 9.999920000639994e-07
403
+ },
404
+ "kl_pairwise": {}
405
+ },
406
+ "action_position[check_dependencies]": {
407
+ "model": {
408
+ "frequency": 1.0,
409
+ "mean_position": 1.75,
410
+ "median_position": 2.0,
411
+ "n": 8
412
+ }
413
+ },
414
+ "confidence_calibration": {
415
+ "model": {
416
+ "ece": 0.925,
417
+ "buckets": [
418
+ {
419
+ "bucket_low": 0.0,
420
+ "bucket_high": 0.1,
421
+ "n": 0,
422
+ "mean_conf": 0.0,
423
+ "accuracy": 0.0
424
+ },
425
+ {
426
+ "bucket_low": 0.1,
427
+ "bucket_high": 0.2,
428
+ "n": 0,
429
+ "mean_conf": 0.0,
430
+ "accuracy": 0.0
431
+ },
432
+ {
433
+ "bucket_low": 0.2,
434
+ "bucket_high": 0.3,
435
+ "n": 0,
436
+ "mean_conf": 0.0,
437
+ "accuracy": 0.0
438
+ },
439
+ {
440
+ "bucket_low": 0.3,
441
+ "bucket_high": 0.4,
442
+ "n": 0,
443
+ "mean_conf": 0.0,
444
+ "accuracy": 0.0
445
+ },
446
+ {
447
+ "bucket_low": 0.4,
448
+ "bucket_high": 0.5,
449
+ "n": 0,
450
+ "mean_conf": 0.0,
451
+ "accuracy": 0.0
452
+ },
453
+ {
454
+ "bucket_low": 0.5,
455
+ "bucket_high": 0.6,
456
+ "n": 0,
457
+ "mean_conf": 0.0,
458
+ "accuracy": 0.0
459
+ },
460
+ {
461
+ "bucket_low": 0.6,
462
+ "bucket_high": 0.7,
463
+ "n": 0,
464
+ "mean_conf": 0.0,
465
+ "accuracy": 0.0
466
+ },
467
+ {
468
+ "bucket_low": 0.7,
469
+ "bucket_high": 0.8,
470
+ "n": 0,
471
+ "mean_conf": 0.0,
472
+ "accuracy": 0.0
473
+ },
474
+ {
475
+ "bucket_low": 0.8,
476
+ "bucket_high": 0.9,
477
+ "n": 2,
478
+ "mean_conf": 0.85,
479
+ "accuracy": 0.0
480
+ },
481
+ {
482
+ "bucket_low": 0.9,
483
+ "bucket_high": 1.0,
484
+ "n": 6,
485
+ "mean_conf": 0.95,
486
+ "accuracy": 0.0
487
+ }
488
+ ],
489
+ "n": 8
490
+ }
491
+ },
492
+ "p2_search_breadth_correlation": {
493
+ "model": {
494
+ "pearson_r": -0.3637,
495
+ "n": 8,
496
+ "mean_breadth": 2.38,
497
+ "mean_confidence": 0.875
498
+ }
499
+ },
500
+ "n_episodes_per_condition": {
501
+ "model": 8
502
+ },
503
+ "n_total": 8
504
+ }
505
+ }
506
+ }
findings/20260426_083700/stopping_distribution.png ADDED