{ "probe": "greedy_generation", "provider": "CUDAExecutionProvider", "session_load_seconds": 28.961127704940736, "step_seconds": [ 0.18181518698111176, 0.030539471190422773, 0.028461792040616274, 0.028141363989561796, 0.028162146918475628, 0.028294692980125546, 0.028191918972879648, 0.028165633091703057 ], "prompt_token_ids": [ 7985, 825, 2805, 11652, 911, 6197, 43304, 13 ], "generated_token_ids": [ 7985, 825, 2805, 11652, 911, 6197, 43304, 13, 6197, 43304, 374, 264, 5411, 1787, 30774, 12626 ], "new_token_ids": [ 6197, 43304, 374, 264, 5411, 1787, 30774, 12626 ], "text": "Write one short sentence about ONNX. ONNX is a popular open-source framework", "finite_logits": true, "source_model": "Qwen/Qwen2.5-0.5B-Instruct", "source_revision": "7ae557604adf67be50417f59c2c2f167def9a775", "versions": { "python": "3.12.9", "onnxruntime": "1.29.0", "onnx_ir": "1.0.0", "transformers": "5.15.1", "torch": "2.13.0+cu130", "numpy": "2.5.2", "providers_available": [ "TensorrtExecutionProvider", "CUDAExecutionProvider", "CPUExecutionProvider" ] } }