{ "probe": "greedy_generation", "provider": "CUDAExecutionProvider", "session_load_seconds": 28.961127704940736, "step_seconds": [ 0.18181518698111176, 0.030539471190422773, 0.028461792040616274, 0.028141363989561796, 0.028162146918475628, 0.028294692980125546, 0.028191918972879648, 0.028165633091703057 ], "finite_logits": true, "versions": { "python": "3.12.9", "onnxruntime": "1.29.0", "onnx_ir": "1.0.0", "transformers": "5.15.1", "torch": "2.13.0+cu130", "numpy": "2.5.2", "providers_available": [ "TensorrtExecutionProvider", "CUDAExecutionProvider", "CPUExecutionProvider" ] }, "hardware": "NVIDIA H200 host; provider is recorded per probe" }