2026-09-13T09:45:15.405057Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="compile_runtime"}: package build phase finished phase="compile_runtime" elapsed_ms=0 success=true 2026-09-13T09:45:15.508011Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: loaded mid-plan search state path=artifacts/bs1-audit-search-20260913/input-state.json attempts=63 2026-09-13T09:45:16.196277Z DEBUG ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:45:16.196501Z DEBUG ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:45:16.196575Z DEBUG ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:45:16.196887Z DEBUG ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:45:16.196977Z DEBUG ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:45:16.197544Z DEBUG ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:45:25.761927Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: screened exchange table geometry expansion_ms=7905 expansion_and_footprint_ms=9495 estimated_row_bytes=37752 heuristic_row_bytes=105028 geometry_fragments_per_tile=4329 fragment_limit=16384 2026-09-13T09:45:25.895018Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: eliminated unread FP8 cast input padding clears removed=612 2026-09-13T09:45:26.561405Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=55 candidates=4 ordinary_horizon=69 paired_horizon=128 use_paired=false 2026-09-13T09:45:26.624038Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=46 transfers=1152 maximum_identical_destinations=1 2026-09-13T09:45:26.624071Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=46 initial_horizon=5743 selected_horizon=5743 endpoint_lower_bound=5632 lower_bound_gap=111 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.625794Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=46 tile=79 row_words=46 horizon=5743 2026-09-13T09:45:26.626854Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=4 transfers=3650 maximum_identical_destinations=1 2026-09-13T09:45:26.626883Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=4 initial_horizon=1927 selected_horizon=1927 endpoint_lower_bound=1152 lower_bound_gap=775 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.630661Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=4 tile=21 row_words=25 horizon=1927 2026-09-13T09:45:26.642353Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=58 transfers=1288 maximum_identical_destinations=1 2026-09-13T09:45:26.642372Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=58 initial_horizon=326 selected_horizon=326 endpoint_lower_bound=224 lower_bound_gap=102 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.642539Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=32 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:45:26.642559Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=32 initial_horizon=2978 selected_horizon=2978 endpoint_lower_bound=2304 lower_bound_gap=674 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.642888Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=40 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:45:26.642907Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=40 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.644657Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=58 tile=89 row_words=15 horizon=326 2026-09-13T09:45:26.645035Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=40 tile=47 row_words=23 horizon=374 2026-09-13T09:45:26.645410Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=32 tile=13 row_words=21 horizon=2978 2026-09-13T09:45:26.646038Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=50 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:45:26.646059Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=50 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.649193Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=1 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:45:26.649236Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=1 initial_horizon=703 selected_horizon=703 endpoint_lower_bound=512 lower_bound_gap=191 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.649243Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=49 candidates=17 ordinary_horizon=688 paired_horizon=1417 use_paired=false 2026-09-13T09:45:26.649707Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=50 tile=866 row_words=10 horizon=471 2026-09-13T09:45:26.653313Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=1 tile=1109 row_words=14 horizon=703 2026-09-13T09:45:26.661826Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=51 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:45:26.661842Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=51 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.663869Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=51 tile=47 row_words=23 horizon=374 2026-09-13T09:45:26.671107Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=22 transfers=1475 maximum_identical_destinations=1 2026-09-13T09:45:26.671132Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=22 initial_horizon=2545 selected_horizon=2545 endpoint_lower_bound=1728 lower_bound_gap=817 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.671815Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=42 transfers=1745 maximum_identical_destinations=1 2026-09-13T09:45:26.671833Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=42 initial_horizon=2165 selected_horizon=2165 endpoint_lower_bound=900 lower_bound_gap=1265 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.673035Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=56 candidates=36 ordinary_horizon=232 paired_horizon=1392 use_paired=false 2026-09-13T09:45:26.674785Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=22 tile=171 row_words=32 horizon=2545 2026-09-13T09:45:26.675437Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=42 tile=6 row_words=44 horizon=2165 2026-09-13T09:45:26.676966Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=59 transfers=2151 maximum_identical_destinations=1 2026-09-13T09:45:26.676981Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=59 initial_horizon=172 selected_horizon=172 endpoint_lower_bound=64 lower_bound_gap=108 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.680176Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=59 tile=1109 row_words=40 horizon=172 2026-09-13T09:45:26.689398Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=21 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:45:26.689421Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=21 initial_horizon=2909 selected_horizon=2909 endpoint_lower_bound=2304 lower_bound_gap=605 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.692049Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=21 tile=22 row_words=23 horizon=2909 2026-09-13T09:45:26.696111Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=38 candidates=72 ordinary_horizon=162 paired_horizon=268 use_paired=false 2026-09-13T09:45:26.705066Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=62 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:45:26.705085Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=62 initial_horizon=406 selected_horizon=406 endpoint_lower_bound=304 lower_bound_gap=102 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.707118Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=62 tile=47 row_words=25 horizon=406 2026-09-13T09:45:26.710115Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=39 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:45:26.710138Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=39 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.713366Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=39 tile=866 row_words=10 horizon=471 2026-09-13T09:45:26.715046Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=57 transfers=9654 maximum_identical_destinations=1 2026-09-13T09:45:26.715072Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=57 initial_horizon=1690 selected_horizon=1690 endpoint_lower_bound=1280 lower_bound_gap=410 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.728890Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=57 tile=943 row_words=46 horizon=1690 2026-09-13T09:45:26.761853Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=17 transfers=11656 maximum_identical_destinations=1 2026-09-13T09:45:26.761892Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=17 initial_horizon=2617 selected_horizon=2617 endpoint_lower_bound=2304 lower_bound_gap=313 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.772609Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=17 tile=21 row_words=159 horizon=2617 2026-09-13T09:45:26.807882Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=44 transfers=12492 maximum_identical_destinations=1 2026-09-13T09:45:26.807909Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=44 initial_horizon=7065 selected_horizon=7065 endpoint_lower_bound=6756 lower_bound_gap=309 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.813061Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=11 transfers=2913 maximum_identical_destinations=1 2026-09-13T09:45:26.813084Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=11 initial_horizon=3193 selected_horizon=3193 endpoint_lower_bound=1440 lower_bound_gap=1753 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.815372Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=44 tile=64 row_words=135 horizon=7065 2026-09-13T09:45:26.819328Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=11 tile=248 row_words=21 horizon=3193 2026-09-13T09:45:26.874534Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=35 transfers=1296 maximum_identical_destinations=1 2026-09-13T09:45:26.874568Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=35 initial_horizon=4287 selected_horizon=4287 endpoint_lower_bound=4096 lower_bound_gap=191 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.879003Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=35 tile=1146 row_words=20 horizon=4287 2026-09-13T09:45:26.921587Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=2 transfers=16520 maximum_identical_destinations=1 2026-09-13T09:45:26.921629Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=2 initial_horizon=3661 selected_horizon=3661 endpoint_lower_bound=3040 lower_bound_gap=621 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.939442Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=2 tile=1061 row_words=90 horizon=3661 2026-09-13T09:45:26.960655Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=24 transfers=9684 maximum_identical_destinations=1 2026-09-13T09:45:26.960702Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=24 initial_horizon=10153 selected_horizon=10153 endpoint_lower_bound=7680 lower_bound_gap=2473 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.969221Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=25 transfers=8694 maximum_identical_destinations=1 2026-09-13T09:45:26.969243Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=25 initial_horizon=14502 selected_horizon=14502 endpoint_lower_bound=7872 lower_bound_gap=6630 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:26.979220Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=25 tile=1428 row_words=47 horizon=14502 2026-09-13T09:45:26.984398Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=24 tile=885 row_words=146 horizon=10153 2026-09-13T09:45:27.009747Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=61 transfers=1725 maximum_identical_destinations=1 2026-09-13T09:45:27.009780Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=61 initial_horizon=1112 selected_horizon=1112 endpoint_lower_bound=896 lower_bound_gap=216 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.016250Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=61 tile=1357 row_words=14 horizon=1112 2026-09-13T09:45:27.018399Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=27 transfers=2820 maximum_identical_destinations=1 2026-09-13T09:45:27.018428Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=27 initial_horizon=3578 selected_horizon=3578 endpoint_lower_bound=1076 lower_bound_gap=2502 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.025322Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=27 tile=1452 row_words=15 horizon=3578 2026-09-13T09:45:27.107601Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=19 transfers=20656 maximum_identical_destinations=1 2026-09-13T09:45:27.107639Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=19 initial_horizon=4485 selected_horizon=4485 endpoint_lower_bound=3648 lower_bound_gap=837 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.129028Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=29 transfers=3096 maximum_identical_destinations=1 2026-09-13T09:45:27.129065Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=29 initial_horizon=9150 selected_horizon=9150 endpoint_lower_bound=5120 lower_bound_gap=4030 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.130108Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=19 tile=535 row_words=106 horizon=4485 2026-09-13T09:45:27.140306Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=29 tile=452 row_words=54 horizon=9150 2026-09-13T09:45:27.159904Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=23 transfers=4374 maximum_identical_destinations=1 2026-09-13T09:45:27.159936Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=23 initial_horizon=8082 selected_horizon=8082 endpoint_lower_bound=7872 lower_bound_gap=210 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.176229Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=23 tile=414 row_words=336 horizon=8082 2026-09-13T09:45:27.197894Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=9 transfers=50544 maximum_identical_destinations=1 2026-09-13T09:45:27.197939Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=9 initial_horizon=9085 selected_horizon=9085 endpoint_lower_bound=7424 lower_bound_gap=1661 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.254487Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=9 tile=473 row_words=171 horizon=9085 2026-09-13T09:45:27.412733Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=16 transfers=50960 maximum_identical_destinations=1 2026-09-13T09:45:27.412774Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=16 initial_horizon=2673 selected_horizon=2673 endpoint_lower_bound=1960 lower_bound_gap=713 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.426467Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=36 transfers=45090 maximum_identical_destinations=1 2026-09-13T09:45:27.426496Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=36 initial_horizon=7433 selected_horizon=7433 endpoint_lower_bound=6048 lower_bound_gap=1385 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.446131Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=16 tile=455 row_words=131 horizon=2673 2026-09-13T09:45:27.453084Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=36 tile=1090 row_words=186 horizon=7433 2026-09-13T09:45:27.662976Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=14 transfers=66320 maximum_identical_destinations=1 2026-09-13T09:45:27.663010Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=14 initial_horizon=7135 selected_horizon=7135 endpoint_lower_bound=3240 lower_bound_gap=3895 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.697647Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=31 transfers=51925 maximum_identical_destinations=1 2026-09-13T09:45:27.697681Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=31 initial_horizon=822 selected_horizon=822 endpoint_lower_bound=576 lower_bound_gap=246 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.710681Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=14 tile=964 row_words=285 horizon=7135 2026-09-13T09:45:27.715195Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=20 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:45:27.715232Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=20 initial_horizon=850 selected_horizon=850 endpoint_lower_bound=576 lower_bound_gap=274 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:27.728865Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=31 tile=1095 row_words=136 horizon=822 2026-09-13T09:45:27.751754Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=20 tile=356 row_words=177 horizon=850 2026-09-13T09:45:28.220183Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=15 transfers=71104 maximum_identical_destinations=1 2026-09-13T09:45:28.220227Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=15 initial_horizon=11776 selected_horizon=11776 endpoint_lower_bound=8768 lower_bound_gap=3008 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:28.262771Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=15 tile=79 row_words=272 horizon=11776 2026-09-13T09:45:28.419146Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=60 candidates=948 ordinary_horizon=531 paired_horizon=2883 use_paired=false 2026-09-13T09:45:28.449971Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=60 transfers=1076 maximum_identical_destinations=1 2026-09-13T09:45:28.450000Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=60 initial_horizon=531 selected_horizon=531 endpoint_lower_bound=112 lower_bound_gap=419 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:28.454113Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=3 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:45:28.454140Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=3 initial_horizon=846 selected_horizon=846 endpoint_lower_bound=576 lower_bound_gap=270 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:28.461847Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=60 tile=1075 row_words=94 horizon=531 2026-09-13T09:45:28.502974Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=3 tile=356 row_words=177 horizon=846 2026-09-13T09:45:28.692013Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=28 transfers=21111 maximum_identical_destinations=1 2026-09-13T09:45:28.692065Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=28 initial_horizon=10169 selected_horizon=10169 endpoint_lower_bound=9760 lower_bound_gap=409 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:28.752719Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=28 tile=481 row_words=518 horizon=10169 2026-09-13T09:45:28.757444Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=37 transfers=103635 maximum_identical_destinations=1 2026-09-13T09:45:28.757469Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=37 initial_horizon=1463 selected_horizon=1463 endpoint_lower_bound=1152 lower_bound_gap=311 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:28.822633Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=34 candidates=6561 ordinary_horizon=7906 paired_horizon=6794 use_paired=false 2026-09-13T09:45:28.830348Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=37 tile=235 row_words=253 horizon=1463 2026-09-13T09:45:28.873689Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=34 transfers=6561 maximum_identical_destinations=1 2026-09-13T09:45:28.873722Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=34 initial_horizon=7906 selected_horizon=7906 endpoint_lower_bound=5248 lower_bound_gap=2658 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:28.894838Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=34 tile=263 row_words=258 horizon=7906 2026-09-13T09:45:29.165053Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=30 transfers=112284 maximum_identical_destinations=1 2026-09-13T09:45:29.165086Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=30 initial_horizon=14301 selected_horizon=14301 endpoint_lower_bound=9072 lower_bound_gap=5229 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:29.252310Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=30 tile=707 row_words=445 horizon=14301 2026-09-13T09:45:29.358753Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=18 candidates=6660 ordinary_horizon=5369 paired_horizon=11106 use_paired=false 2026-09-13T09:45:29.431724Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=18 transfers=8388 maximum_identical_destinations=1 2026-09-13T09:45:29.431765Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=18 initial_horizon=5369 selected_horizon=5369 endpoint_lower_bound=4656 lower_bound_gap=713 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:29.465156Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=18 tile=36 row_words=354 horizon=5369 2026-09-13T09:45:29.781865Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=43 transfers=69906 maximum_identical_destinations=1 2026-09-13T09:45:29.781908Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=43 initial_horizon=5521 selected_horizon=5521 endpoint_lower_bound=2816 lower_bound_gap=2705 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:29.847421Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=43 tile=97 row_words=502 horizon=5521 2026-09-13T09:45:30.022043Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=13 transfers=33676 maximum_identical_destinations=1 2026-09-13T09:45:30.022080Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=13 initial_horizon=12868 selected_horizon=12868 endpoint_lower_bound=11940 lower_bound_gap=928 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:30.027022Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=10 transfers=155252 maximum_identical_destinations=1 2026-09-13T09:45:30.027052Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=10 initial_horizon=2258 selected_horizon=2258 endpoint_lower_bound=1728 lower_bound_gap=530 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:30.096725Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=13 tile=79 row_words=628 horizon=12868 2026-09-13T09:45:30.145960Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=10 tile=231 row_words=310 horizon=2258 2026-09-13T09:45:31.885439Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=0 candidates=1692 ordinary_horizon=6634 paired_horizon=5480 use_paired=false 2026-09-13T09:45:31.920009Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=0 transfers=2421 maximum_identical_destinations=1 2026-09-13T09:45:31.920049Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=0 initial_horizon=6634 selected_horizon=6634 endpoint_lower_bound=2944 lower_bound_gap=3690 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:31.945860Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=0 tile=359 row_words=389 horizon=6634 2026-09-13T09:45:32.333040Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: compared ordinary and paired exchange schedules phase=8 candidates=6588 ordinary_horizon=17260 paired_horizon=25623 use_paired=false 2026-09-13T09:45:32.476498Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=8 transfers=9180 maximum_identical_destinations=1 2026-09-13T09:45:32.476530Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=8 initial_horizon=17260 selected_horizon=17260 endpoint_lower_bound=9856 lower_bound_gap=7404 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:32.538830Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=8 tile=104 row_words=649 horizon=17260 2026-09-13T09:45:33.271349Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=26 transfers=195689 maximum_identical_destinations=1 2026-09-13T09:45:33.271387Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=26 initial_horizon=2731 selected_horizon=2731 endpoint_lower_bound=2152 lower_bound_gap=579 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:33.468767Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=26 tile=553 row_words=658 horizon=2731 2026-09-13T09:45:33.617472Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: prepared large physical exchange phase phase=12 transfers=128094 maximum_identical_destinations=1 2026-09-13T09:45:33.617511Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: optimized physical exchange schedule phase=12 initial_horizon=4502 selected_horizon=4502 endpoint_lower_bound=1440 lower_bound_gap=3062 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:33.737670Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: finished large physical exchange phase phase=12 tile=454 row_words=620 horizon=4502 2026-09-13T09:45:33.802408Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="plan_kernels"}: package build phase finished phase="plan_kernels" elapsed_ms=47 success=true 2026-09-13T09:45:33.807696Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="compile_kernels"}: package build phase finished phase="compile_kernels" elapsed_ms=5 success=true 2026-09-13T09:45:33.813761Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="link_runtime"}: package build phase finished phase="link_runtime" elapsed_ms=0 success=true 2026-09-13T09:45:34.255533Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: exchange table and repeat patch storage exchange_table_bytes=28144 maximum_uncompressed_repeat_patch_bytes=1404 maximum_elided_arithmetic_patch_bytes=1404 2026-09-13T09:45:36.831328Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="size_tile_code"}: package build phase finished phase="size_tile_code" elapsed_ms=45 success=true 2026-09-13T09:45:36.831510Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: placing generated tile programs linked_end=385008 host_code_base=385008 host_code_bytes=8892 generated_code_bytes=9744 exchange_table_bytes=28144 executable_ranges=[(377220, 377224), (378228, 378232), (380284, 380288), (384028, 384032), (393968, 524288)] 2026-09-13T09:45:36.831526Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: allocated package support memory linked_end=385008 profile_bytes=0 exchange_table_bytes=28144 host_code_bytes=8892 host_data_bytes=6148 generated_code_bytes=9744 code_address=393968 available_ranges=[(327680, 360448), (368356, 376832), (442368, 949168)] 2026-09-13T09:45:37.476709Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="place_storage"}: package build phase finished phase="place_storage" elapsed_ms=645 success=true 2026-09-13T09:45:37.533643Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=48 2026-09-13T09:45:37.538572Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=52 2026-09-13T09:45:37.543297Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=49 2026-09-13T09:45:37.544038Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=53 2026-09-13T09:45:37.545480Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=54 2026-09-13T09:45:37.545819Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=58 2026-09-13T09:45:37.546230Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=55 2026-09-13T09:45:37.546379Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=58 transfers=1288 maximum_identical_destinations=1 2026-09-13T09:45:37.546388Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=58 initial_horizon=326 selected_horizon=326 endpoint_lower_bound=224 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.549268Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=40 2026-09-13T09:45:37.549650Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=58 tile=89 row_words=15 horizon=326 2026-09-13T09:45:37.550032Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=40 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:45:37.550046Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=40 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.553420Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=40 tile=47 row_words=23 horizon=374 2026-09-13T09:45:37.553793Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=32 2026-09-13T09:45:37.554707Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=32 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:45:37.554729Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=32 initial_horizon=2978 selected_horizon=2978 endpoint_lower_bound=2304 lower_bound_gap=674 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.558968Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=50 2026-09-13T09:45:37.559615Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=50 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:45:37.559627Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=50 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.559680Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=32 tile=13 row_words=21 horizon=2978 2026-09-13T09:45:37.560565Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=41 2026-09-13T09:45:37.562588Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=1 2026-09-13T09:45:37.564358Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=1 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:45:37.564377Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=1 initial_horizon=703 selected_horizon=703 endpoint_lower_bound=512 lower_bound_gap=191 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.564628Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=50 tile=866 row_words=10 horizon=471 2026-09-13T09:45:37.568320Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=38 2026-09-13T09:45:37.571464Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=1 tile=1109 row_words=14 horizon=703 2026-09-13T09:45:37.574650Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=56 2026-09-13T09:45:37.576025Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=51 2026-09-13T09:45:37.576577Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=51 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:45:37.576594Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=51 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.579711Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=51 tile=47 row_words=23 horizon=374 2026-09-13T09:45:37.580056Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=4 2026-09-13T09:45:37.582544Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=4 transfers=3650 maximum_identical_destinations=1 2026-09-13T09:45:37.582568Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=4 initial_horizon=1927 selected_horizon=1927 endpoint_lower_bound=1152 lower_bound_gap=775 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.583687Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=42 2026-09-13T09:45:37.584494Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=42 transfers=1745 maximum_identical_destinations=1 2026-09-13T09:45:37.584505Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=42 initial_horizon=2165 selected_horizon=2165 endpoint_lower_bound=900 lower_bound_gap=1265 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.586945Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=35 2026-09-13T09:45:37.588231Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=42 tile=6 row_words=44 horizon=2165 2026-09-13T09:45:37.588800Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=35 transfers=1296 maximum_identical_destinations=1 2026-09-13T09:45:37.588809Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=35 initial_horizon=4287 selected_horizon=4287 endpoint_lower_bound=4096 lower_bound_gap=191 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.589280Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=4 tile=21 row_words=25 horizon=1927 2026-09-13T09:45:37.589816Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=39 2026-09-13T09:45:37.590374Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=39 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:45:37.590392Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=39 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.591466Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=62 2026-09-13T09:45:37.591974Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=62 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:45:37.591985Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=62 initial_horizon=406 selected_horizon=406 endpoint_lower_bound=304 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.594387Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=35 tile=1146 row_words=20 horizon=4287 2026-09-13T09:45:37.594451Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=39 tile=866 row_words=10 horizon=471 2026-09-13T09:45:37.594876Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=62 tile=47 row_words=25 horizon=406 2026-09-13T09:45:37.597472Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=59 2026-09-13T09:45:37.598814Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=59 transfers=2151 maximum_identical_destinations=1 2026-09-13T09:45:37.598831Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=59 initial_horizon=172 selected_horizon=172 endpoint_lower_bound=64 lower_bound_gap=108 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.600116Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=5 2026-09-13T09:45:37.600552Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=63 2026-09-13T09:45:37.604183Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=59 tile=1109 row_words=40 horizon=172 2026-09-13T09:45:37.606374Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=21 2026-09-13T09:45:37.606746Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=64 2026-09-13T09:45:37.606870Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=21 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:45:37.606877Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=21 initial_horizon=2909 selected_horizon=2909 endpoint_lower_bound=2304 lower_bound_gap=605 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.610051Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=21 tile=22 row_words=23 horizon=2909 2026-09-13T09:45:37.616793Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=46 2026-09-13T09:45:37.617224Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=46 transfers=1152 maximum_identical_destinations=1 2026-09-13T09:45:37.617232Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=46 initial_horizon=5743 selected_horizon=5743 endpoint_lower_bound=5632 lower_bound_gap=111 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.618799Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=46 tile=79 row_words=46 horizon=5743 2026-09-13T09:45:37.620444Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=33 2026-09-13T09:45:37.622344Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=47 2026-09-13T09:45:37.648858Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=22 2026-09-13T09:45:37.652430Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=22 transfers=1475 maximum_identical_destinations=1 2026-09-13T09:45:37.652456Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=22 initial_horizon=2545 selected_horizon=2545 endpoint_lower_bound=1728 lower_bound_gap=817 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.657047Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=22 tile=171 row_words=32 horizon=2545 2026-09-13T09:45:37.666311Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=6 2026-09-13T09:45:37.678580Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=7 2026-09-13T09:45:37.680448Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=57 2026-09-13T09:45:37.687092Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=57 transfers=9654 maximum_identical_destinations=1 2026-09-13T09:45:37.687112Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=57 initial_horizon=1690 selected_horizon=1690 endpoint_lower_bound=1280 lower_bound_gap=410 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.691748Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=61 2026-09-13T09:45:37.692219Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=61 transfers=1725 maximum_identical_destinations=1 2026-09-13T09:45:37.692232Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=61 initial_horizon=1112 selected_horizon=1112 endpoint_lower_bound=896 lower_bound_gap=216 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.692428Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=44 2026-09-13T09:45:37.693908Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=27 2026-09-13T09:45:37.694906Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=27 transfers=2820 maximum_identical_destinations=1 2026-09-13T09:45:37.694920Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=27 initial_horizon=3578 selected_horizon=3578 endpoint_lower_bound=1076 lower_bound_gap=2502 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.695166Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=61 tile=1357 row_words=14 horizon=1112 2026-09-13T09:45:37.697459Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=44 transfers=12492 maximum_identical_destinations=1 2026-09-13T09:45:37.697476Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=44 initial_horizon=7065 selected_horizon=7065 endpoint_lower_bound=6756 lower_bound_gap=309 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.699638Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=27 tile=1452 row_words=15 horizon=3578 2026-09-13T09:45:37.704141Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=57 tile=943 row_words=46 horizon=1690 2026-09-13T09:45:37.706282Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=44 tile=64 row_words=135 horizon=7065 2026-09-13T09:45:37.712498Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=45 2026-09-13T09:45:37.767590Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=11 2026-09-13T09:45:37.769258Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=11 transfers=2913 maximum_identical_destinations=1 2026-09-13T09:45:37.769286Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=11 initial_horizon=3193 selected_horizon=3193 endpoint_lower_bound=1440 lower_bound_gap=1753 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.776390Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=11 tile=248 row_words=21 horizon=3193 2026-09-13T09:45:37.852062Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=29 transfers=3096 maximum_identical_destinations=1 2026-09-13T09:45:37.852107Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=29 initial_horizon=8353 selected_horizon=8353 endpoint_lower_bound=5120 lower_bound_gap=3233 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:37.853006Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=25 transfers=8694 maximum_identical_destinations=1 2026-09-13T09:45:37.853032Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=25 initial_horizon=10602 selected_horizon=10602 endpoint_lower_bound=7872 lower_bound_gap=2730 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:37.854371Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=17 2026-09-13T09:45:37.860098Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=17 transfers=11656 maximum_identical_destinations=1 2026-09-13T09:45:37.860114Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=17 initial_horizon=2617 selected_horizon=2617 endpoint_lower_bound=2304 lower_bound_gap=313 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:37.864917Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=25 tile=1428 row_words=47 horizon=10602 2026-09-13T09:45:37.865363Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=29 tile=1424 row_words=52 horizon=8353 2026-09-13T09:45:37.869977Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=17 tile=21 row_words=159 horizon=2617 2026-09-13T09:45:38.016598Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=19 2026-09-13T09:45:38.027284Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=19 transfers=20656 maximum_identical_destinations=1 2026-09-13T09:45:38.027304Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=19 initial_horizon=4485 selected_horizon=4485 endpoint_lower_bound=3648 lower_bound_gap=837 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.050523Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=19 tile=535 row_words=106 horizon=4485 2026-09-13T09:45:38.113760Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=9 2026-09-13T09:45:38.139021Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=9 transfers=50544 maximum_identical_destinations=1 2026-09-13T09:45:38.139047Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=9 initial_horizon=9085 selected_horizon=9085 endpoint_lower_bound=7424 lower_bound_gap=1661 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.175884Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=9 tile=473 row_words=171 horizon=9085 2026-09-13T09:45:38.179833Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=36 2026-09-13T09:45:38.205069Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=36 transfers=45090 maximum_identical_destinations=1 2026-09-13T09:45:38.205091Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=36 initial_horizon=7433 selected_horizon=7433 endpoint_lower_bound=6048 lower_bound_gap=1385 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.248354Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=36 tile=1090 row_words=186 horizon=7433 2026-09-13T09:45:38.306381Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=16 2026-09-13T09:45:38.338684Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=16 transfers=50960 maximum_identical_destinations=1 2026-09-13T09:45:38.338715Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=16 initial_horizon=2673 selected_horizon=2673 endpoint_lower_bound=1960 lower_bound_gap=713 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.354947Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=24 transfers=9684 maximum_identical_destinations=1 2026-09-13T09:45:38.354982Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=24 initial_horizon=9286 selected_horizon=9286 endpoint_lower_bound=7680 lower_bound_gap=1606 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:38.374574Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=16 tile=455 row_words=131 horizon=2673 2026-09-13T09:45:38.379507Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=24 tile=746 row_words=143 horizon=9286 2026-09-13T09:45:38.402368Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=60 2026-09-13T09:45:38.419714Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=60 transfers=1076 maximum_identical_destinations=1 2026-09-13T09:45:38.419741Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=60 initial_horizon=531 selected_horizon=531 endpoint_lower_bound=112 lower_bound_gap=419 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.429259Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=60 tile=1075 row_words=94 horizon=531 2026-09-13T09:45:38.667427Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=31 2026-09-13T09:45:38.695751Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=31 transfers=51925 maximum_identical_destinations=1 2026-09-13T09:45:38.695791Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=31 initial_horizon=822 selected_horizon=822 endpoint_lower_bound=576 lower_bound_gap=246 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.713614Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=3 2026-09-13T09:45:38.736225Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=31 tile=1095 row_words=136 horizon=822 2026-09-13T09:45:38.740495Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=3 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:45:38.740512Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=3 initial_horizon=846 selected_horizon=846 endpoint_lower_bound=576 lower_bound_gap=270 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.766454Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=20 2026-09-13T09:45:38.788440Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=3 tile=356 row_words=177 horizon=846 2026-09-13T09:45:38.797643Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=20 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:45:38.797666Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=20 initial_horizon=850 selected_horizon=850 endpoint_lower_bound=576 lower_bound_gap=274 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:38.848787Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=20 tile=356 row_words=177 horizon=850 2026-09-13T09:45:39.052389Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=34 2026-09-13T09:45:39.077361Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=34 transfers=6561 maximum_identical_destinations=1 2026-09-13T09:45:39.077383Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=34 initial_horizon=7906 selected_horizon=7906 endpoint_lower_bound=5248 lower_bound_gap=2658 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:39.098480Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=34 tile=263 row_words=258 horizon=7906 2026-09-13T09:45:39.100315Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=15 2026-09-13T09:45:39.136956Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=15 transfers=71104 maximum_identical_destinations=1 2026-09-13T09:45:39.136990Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=15 initial_horizon=11776 selected_horizon=11776 endpoint_lower_bound=8768 lower_bound_gap=3008 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:39.188993Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=15 tile=79 row_words=272 horizon=11776 2026-09-13T09:45:39.578138Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=43 2026-09-13T09:45:39.639548Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=43 transfers=69906 maximum_identical_destinations=1 2026-09-13T09:45:39.639575Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=43 initial_horizon=5521 selected_horizon=5521 endpoint_lower_bound=2816 lower_bound_gap=2705 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:39.698151Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=43 tile=97 row_words=502 horizon=5521 2026-09-13T09:45:39.777423Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=10 2026-09-13T09:45:39.831924Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=10 transfers=155252 maximum_identical_destinations=1 2026-09-13T09:45:39.831949Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=10 initial_horizon=2258 selected_horizon=2258 endpoint_lower_bound=1728 lower_bound_gap=530 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:39.918769Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=10 tile=231 row_words=310 horizon=2258 2026-09-13T09:45:40.312180Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=18 2026-09-13T09:45:40.355147Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=18 transfers=8388 maximum_identical_destinations=1 2026-09-13T09:45:40.355177Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=18 initial_horizon=5369 selected_horizon=5369 endpoint_lower_bound=4656 lower_bound_gap=713 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:40.402295Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=18 tile=36 row_words=354 horizon=5369 2026-09-13T09:45:40.460733Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=14 transfers=66320 maximum_identical_destinations=1 2026-09-13T09:45:40.460770Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=14 initial_horizon=7003 selected_horizon=7003 endpoint_lower_bound=3240 lower_bound_gap=3763 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:40.506498Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=14 tile=322 row_words=279 horizon=7003 2026-09-13T09:45:40.555332Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=13 2026-09-13T09:45:40.627017Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=13 transfers=33676 maximum_identical_destinations=1 2026-09-13T09:45:40.627054Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=13 initial_horizon=12868 selected_horizon=12868 endpoint_lower_bound=11940 lower_bound_gap=928 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:40.700271Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=13 tile=79 row_words=628 horizon=12868 2026-09-13T09:45:41.070192Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=23 2026-09-13T09:45:41.096578Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=23 transfers=4374 maximum_identical_destinations=1 2026-09-13T09:45:41.096609Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=23 initial_horizon=8082 selected_horizon=8082 endpoint_lower_bound=7872 lower_bound_gap=210 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:41.116392Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=23 tile=414 row_words=336 horizon=8082 2026-09-13T09:45:41.360104Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=2 2026-09-13T09:45:41.370736Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=2 transfers=16520 maximum_identical_destinations=1 2026-09-13T09:45:41.370755Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=2 initial_horizon=3661 selected_horizon=3661 endpoint_lower_bound=3040 lower_bound_gap=621 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:41.388860Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=2 tile=1061 row_words=90 horizon=3661 2026-09-13T09:45:41.767598Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=28 2026-09-13T09:45:41.818496Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=28 transfers=21111 maximum_identical_destinations=1 2026-09-13T09:45:41.818525Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=28 initial_horizon=10169 selected_horizon=10169 endpoint_lower_bound=9760 lower_bound_gap=409 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:41.880278Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=28 tile=481 row_words=518 horizon=10169 2026-09-13T09:45:42.161898Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=30 transfers=112284 maximum_identical_destinations=1 2026-09-13T09:45:42.161938Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=30 initial_horizon=10541 selected_horizon=10541 endpoint_lower_bound=9072 lower_bound_gap=1469 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:42.286885Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=30 tile=704 row_words=423 horizon=10541 2026-09-13T09:45:42.685274Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=37 2026-09-13T09:45:42.739657Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=37 transfers=103635 maximum_identical_destinations=1 2026-09-13T09:45:42.739691Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=37 initial_horizon=1463 selected_horizon=1463 endpoint_lower_bound=1152 lower_bound_gap=311 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:42.835291Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=37 tile=235 row_words=253 horizon=1463 2026-09-13T09:45:43.129059Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=26 2026-09-13T09:45:43.239110Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=26 transfers=195689 maximum_identical_destinations=1 2026-09-13T09:45:43.239146Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=26 initial_horizon=2731 selected_horizon=2731 endpoint_lower_bound=2152 lower_bound_gap=579 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:43.532869Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=26 tile=553 row_words=658 horizon=2731 2026-09-13T09:45:44.185245Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=12 2026-09-13T09:45:44.255124Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=12 transfers=128094 maximum_identical_destinations=1 2026-09-13T09:45:44.255147Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=12 initial_horizon=4502 selected_horizon=4502 endpoint_lower_bound=1440 lower_bound_gap=3062 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:44.409701Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=12 tile=454 row_words=620 horizon=4502 2026-09-13T09:45:44.564563Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=0 2026-09-13T09:45:44.583678Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=0 transfers=2421 maximum_identical_destinations=1 2026-09-13T09:45:44.583701Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=0 initial_horizon=6634 selected_horizon=6634 endpoint_lower_bound=2944 lower_bound_gap=3690 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:45:44.599593Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=0 tile=359 row_words=389 horizon=6634 2026-09-13T09:45:46.558507Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: compared ordinary and paired exchange schedules phase=8 candidates=6588 ordinary_horizon=14880 paired_horizon=24695 use_paired=false 2026-09-13T09:45:46.709303Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=8 transfers=9180 maximum_identical_destinations=1 2026-09-13T09:45:46.709340Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=8 initial_horizon=14880 selected_horizon=14880 endpoint_lower_bound=9856 lower_bound_gap=5024 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:45:46.772663Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=8 tile=45 row_words=644 horizon=14880 2026-09-13T09:45:46.779968Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="lower_exchanges"}: package build phase finished phase="lower_exchanges" elapsed_ms=9303 success=true 2026-09-13T09:45:59.116948Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="optimize_exchange_placement"}: package build phase finished phase="optimize_exchange_placement" elapsed_ms=12336 success=true 2026-09-13T09:45:59.148971Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: costed final placed program final_cycles=11763240 final_exchange=4919396 2026-09-13T09:46:00.741060Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="prepare_tile_code"}: package build phase finished phase="prepare_tile_code" elapsed_ms=99 success=true 2026-09-13T09:46:00.831114Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="emit_tile_code"}: package build phase finished phase="emit_tile_code" elapsed_ms=89 success=true 2026-09-13T09:46:01.479385Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:ipu_codegen.package.phase{phase="build_tile_images"}: package build phase finished phase="build_tile_images" elapsed_ms=594 success=true 2026-09-13T09:46:01.751355Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: validated search incumbent cycles=11763240 resuming=true 2026-09-13T09:46:01.805601Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.805810Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.805866Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.805944Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.806114Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.806151Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.806192Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.806238Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.806548Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.806629Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.806632Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.807063Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.807868Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.808055Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.808105Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.808351Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.808434Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.808807Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.808838Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.809064Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.809136Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.809484Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.809606Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.810153Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.812220Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.812431Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.812483Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.812742Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.812823Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.813242Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.818594Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.818812Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.818865Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.819122Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.819225Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.819645Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.822047Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.822353Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.822432Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.822816Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.822911Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.822933Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.823176Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.823271Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.823549Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.823613Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.823725Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.823741Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.823866Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.823963Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824041Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824111Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824127Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824215Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824276Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824327Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.824350Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824474Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824582Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824589Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824698Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824717Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824838Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.824978Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.825179Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.825250Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.825316Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.825337Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.825431Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.825687Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.825797Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.826353Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.826598Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.827016Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.827121Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.827666Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.827857Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.828683Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.841285Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.841690Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.841787Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.842271Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.842435Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.843257Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.845799Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.846234Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.846337Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.846834Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.847006Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.847834Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.848531Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.848911Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.849010Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.849514Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.849694Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.850494Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.856950Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.857330Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18978247 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.859277Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.863505Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18781351 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.871404Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[44] opened_boundaries=[400] 2026-09-13T09:46:01.880939Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18781351 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.889436Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.889627Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.889682Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.889923Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.890003Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.890460Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.891399Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.891591Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.891642Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.891891Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.891973Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.892388Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.894673Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:01.895260Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.895506Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.895625Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.895710Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.895931Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.896043Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.896093Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.896229Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.896304Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18978247 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.896548Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.896716Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.896879Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.897544Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.897700Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.898028Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18694831 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:01.900030Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.900328Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.900395Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.900708Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.900815Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.901371Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.903627Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18700470 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:01.905562Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.906096Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.906244Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.906823Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.907003Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909015Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909226Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909286Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909533Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909527Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909611Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909702Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.909906Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.910029Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.910256Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.910376Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.914835Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.919337Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.919717Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.919813Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.920289Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.920457Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.921298Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.924090Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.924358Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.924436Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.924785Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.924888Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.925243Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.925461Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.934961Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.935227Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.935308Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.935638Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.935749Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.936349Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.938521Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.938783Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.938858Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.938948Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.939227Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.939242Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.939324Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.939354Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.939690Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.939811Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.939948Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.940419Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.941546Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20176694 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:01.943541Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.944549Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.944881Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.944957Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.945356Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.945478Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.946046Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.950577Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.950855Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.950931Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.951272Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.951386Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.951951Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.957666Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:01.959112Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18705403 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:01.960164Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.960461Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.960535Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.960897Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.961010Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.961158Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20176694 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:01.961614Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.961719Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695395 visited=false changed_operations=[44, 45] opened_boundaries=[400] 2026-09-13T09:46:01.967014Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689822 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:01.969431Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.969727Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.969801Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.970139Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.970281Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.970874Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.977760Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18960668 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:01.978101Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:01.980811Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.981005Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.981061Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.981321Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.981417Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.981849Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.983384Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695331 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:01.988645Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.988830Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.988883Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.989115Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.989195Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.989617Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:01.991475Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.991686Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.991739Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.991987Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.992065Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:01.992494Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.000063Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.000341Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.000417Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.000532Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18708149 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:02.000753Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.000871Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.001485Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.004008Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19354247 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:02.005087Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:02.007849Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.011750Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.014706Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18694831 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:02.015127Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.015439Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.015525Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.015894Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.016005Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.016610Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.020820Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021114Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021195Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021222Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021505Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021581Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021589Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021699Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.021946Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.022064Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.022335Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.022689Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.029248Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18719774 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:02.030522Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:02.035151Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.043249Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19204711 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.044472Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.044851Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.044960Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.045487Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.045658Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.046500Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.047395Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.047780Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.047874Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.048170Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.048341Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.049118Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.051128Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.051496Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.051604Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.052083Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.052254Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.053056Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.053178Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.054256Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695395 visited=false changed_operations=[44, 45] opened_boundaries=[400] 2026-09-13T09:46:02.063740Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18938015 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:02.064336Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.064758Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.064855Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.065339Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.065498Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.066254Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.074994Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.075247Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.075529Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.076016Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.076185Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.082880Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.083158Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.083263Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.083641Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.083757Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.084386Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.084956Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18705403 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:02.085315Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.085594Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.085674Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.086016Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.086126Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.086724Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.090643Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.090718Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.090943Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.090962Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.091018Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.091042Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.091390Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.091397Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.091510Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.091665Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.092084Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.092289Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.092358Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.092653Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.092733Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.093092Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.093222Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.093819Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.097101Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.097387Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.097461Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.097800Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.097914Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.098529Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.103094Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20176694 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:02.104368Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.107973Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.108263Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.108337Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.108697Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.108717Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18960668 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:02.108820Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.109440Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.119259Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.119649Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.119763Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.120280Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.120453Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.121304Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.121509Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18941903 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.123604Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:02.124533Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18708149 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:02.126229Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.126499Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.126573Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.126907Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.127014Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.127622Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.129783Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693347 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:02.144577Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.144861Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.144935Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.145230Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.145312Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.145424Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.145511Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.145587Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.145930Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.146024Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.146045Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.146663Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.148673Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19204711 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.152664Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.155447Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696007 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:02.156757Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.158975Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18719774 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:02.162305Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.162560Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.162633Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.162807Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.162920Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.163475Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19345607 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:02.163511Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.164090Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.164346Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.164423Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.164759Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.164871Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.165469Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.165537Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.165798Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.165874Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.166252Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.166375Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.166976Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.167730Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18825695 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.184728Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.184912Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.184961Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.185193Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.185291Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.185731Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.186867Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18938015 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:02.189619Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.189885Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.189959Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.190319Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.190439Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.191028Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.191584Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.191866Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.191947Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.192327Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.192446Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.193057Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.194233Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.194399Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.194594Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.194928Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.195053Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.196545Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.196822Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.196898Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.197275Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.197292Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.197400Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.197549Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.197628Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.197978Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.198000Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.198090Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.198437Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18705403 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:02.198689Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.201500Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.201773Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.201853Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.202217Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.202336Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.202942Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.203775Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.204024Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.204102Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.204478Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.204598Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.205174Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.209395Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.209688Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.209769Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.210122Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.210409Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.211018Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.211039Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[400] 2026-09-13T09:46:02.217878Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.218650Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18938015 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:02.233112Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693347 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:02.235273Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.235898Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18941903 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.238180Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:02.241557Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.242034Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.242134Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.242650Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.242816Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.243715Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.244254Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.244558Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.244635Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.245013Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.245141Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.245750Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.246355Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18708149 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:02.259894Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.260173Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.260269Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.260616Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.260734Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.261342Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.268459Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.268719Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.268776Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.269055Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.269147Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.269619Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.271829Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.272274Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.272387Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.272915Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.273104Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.273962Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.274048Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[7] opened_boundaries=[] 2026-09-13T09:46:02.274744Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.275007Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.275088Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.275470Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.275590Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.276232Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.276796Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.277071Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.277176Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.277702Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.277888Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.279171Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.279419Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696007 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:02.281669Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18791594 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:02.286315Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.286517Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.286574Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.286850Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.286976Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.287059Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19345607 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:02.287478Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.288960Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18719774 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:02.291105Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.291376Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.291460Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.291810Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.291927Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.292534Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.305878Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18825695 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.315006Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:02.315166Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.315458Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.315540Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.315899Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.316019Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.316626Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.319821Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18705403 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:02.321641Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18758913 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.322684Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18938015 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:02.334399Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18944927 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:02.335582Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.335837Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.335910Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.336288Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.336403Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.336994Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.337598Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.337895Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.337973Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.338372Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.338494Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.339104Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.339776Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18710322 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.341895Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.342178Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.342277Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.342627Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.342749Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.343370Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.343485Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.343754Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.343839Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.344235Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.344360Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.344961Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.346436Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:02.351468Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.351727Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.351800Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.351830Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.352021Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.352069Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.352116Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.352222Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.352341Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.352443Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.352727Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.352973Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.361076Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.361367Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.361442Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.361779Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.361887Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.362496Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.363513Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[400] 2026-09-13T09:46:02.365690Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18708149 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:02.369621Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.369802Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.369864Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.370101Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.370185Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.370615Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.372402Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.372590Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.372665Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.373029Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.373145Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.377776Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.378043Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.378116Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.378498Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.378622Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.379241Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.386835Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.387088Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.387176Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.387535Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.387654Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.388272Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.388988Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[7] opened_boundaries=[] 2026-09-13T09:46:02.406877Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.407139Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 32, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.407438Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.407778Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.407893Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.408498Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.408695Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.410270Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18758913 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.416513Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696007 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:02.417279Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:02.419272Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18719774 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:02.419891Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18944927 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:02.425704Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18710322 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.426765Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.427240Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.427359Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.427885Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.428054Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.428875Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.431189Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.431604Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.431720Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.432232Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.432409Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.433228Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.438004Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18791594 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:02.438561Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18692460 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.460778Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.461145Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.461264Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.461684Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18944927 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:02.461768Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.461796Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.461938Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.462039Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.462144Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.462669Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.462754Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.462845Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.467482Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:02.470344Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.470619Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.470699Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.470878Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.471064Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.471130Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.471176Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.471230Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.471585Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.471700Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.471785Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.472308Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.473504Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.473780Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.473861Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.474251Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.474377Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.474983Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.485374Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.485660Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.485746Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.486047Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.486675Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.487346Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.487745Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.487856Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.488367Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.488537Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.489371Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.491921Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18884304 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.495284Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.495686Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.495791Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.496401Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.496593Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.497444Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.498196Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[400] 2026-09-13T09:46:02.502856Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18724477 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.508140Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.508418Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.508491Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.508835Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.508953Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.509567Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.527695Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.530075Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.530310Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.530369Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.530623Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.530711Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.531140Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.533258Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.533521Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 32, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.533809Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.534157Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.534291Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.534893Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.540816Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:02.543515Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18944927 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:02.543851Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.544020Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.544095Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.544475Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.544597Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.545974Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.546263Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.546344Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.546693Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.546809Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.547414Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.550626Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699728 visited=false changed_operations=[44] opened_boundaries=[399] 2026-09-13T09:46:02.557788Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.563273Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18749582 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:02.577948Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.578379Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.578485Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.578970Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.579138Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.579636Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18692460 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.579828Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:02.579965Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.581569Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18724477 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.582568Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.582817Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.582893Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.583267Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.583381Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.583960Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.584949Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.585275Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.585358Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.585711Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.585826Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.586433Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.586891Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[400] 2026-09-13T09:46:02.593034Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.593320Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.593401Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.593752Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.593868Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.594492Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.598730Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.599088Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.599183Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.599675Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.599845Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.600654Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.604886Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.605163Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.605262Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.605580Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.606189Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.606969Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696007 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:02.607498Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.607758Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1462, replicas: 43, axes: [AxisTiling { axis: FromEnd(1), partitions: 34, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1462, replicas: 43, axes: [AxisTiling { axis: FromEnd(1), partitions: 34, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.607836Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.608177Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.608304Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.608902Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.609469Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18884304 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.620359Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.620613Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.620686Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.621023Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.621142Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.621760Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.622239Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.622407Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.622481Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.622599Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.622841Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.622857Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.622933Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.622959Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.623298Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.623413Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.624011Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.624411Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18940472 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:02.626921Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.627124Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.627178Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.627446Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.627526Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.628013Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.658363Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.658557Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.658608Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.658847Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.658931Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.659348Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.666655Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:02.667020Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.667483Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.667604Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.668124Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.668162Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18940472 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:02.668309Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.669112Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.670158Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18706916 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.671339Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.680816Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699728 visited=false changed_operations=[44] opened_boundaries=[399] 2026-09-13T09:46:02.688239Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[6] opened_boundaries=[] 2026-09-13T09:46:02.688990Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.689279Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.689357Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.689700Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.689817Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.690424Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.692393Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18749582 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:02.692416Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691045 visited=false changed_operations=[43] opened_boundaries=[396] 2026-09-13T09:46:02.694763Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699940 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:02.702602Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[] 2026-09-13T09:46:02.710826Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18700470 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:02.729426Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.729825Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.729933Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.730223Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.730462Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.730479Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.730559Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.730626Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.730893Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.731009Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.731442Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.731618Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.732352Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.732622Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.732693Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.733027Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.733146Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.733728Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.734171Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.734443Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.734522Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.734883Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.734996Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.735588Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.735747Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.735934Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.736015Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.736402Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.736531Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.738717Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739006Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739085Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739090Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689304 visited=false changed_operations=[45] opened_boundaries=[400] 2026-09-13T09:46:02.739454Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739465Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739587Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739629Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739679Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739911Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.739993Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.740195Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.740412Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.743168Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.743445Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.743526Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.743884Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.744001Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.744614Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.746870Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.747137Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1462, replicas: 43, axes: [AxisTiling { axis: FromEnd(1), partitions: 34, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1462, replicas: 43, axes: [AxisTiling { axis: FromEnd(1), partitions: 34, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.747226Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.747589Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.747703Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.748308Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.761139Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.761427Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.761504Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.761848Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.761969Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.762569Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.767580Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.767851Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.767931Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.768359Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.768484Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.769095Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.774661Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18706916 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.781882Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.797924Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.798220Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699940 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:02.798337Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.798444Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.798936Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.799102Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.799977Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.799995Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18940472 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:02.800498Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:02.803947Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18700470 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:02.807484Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[6] opened_boundaries=[] 2026-09-13T09:46:02.813250Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:02.815186Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18732743 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:02.816779Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.816950Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.817024Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.817405Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.817522Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.819377Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691045 visited=false changed_operations=[43] opened_boundaries=[396] 2026-09-13T09:46:02.830622Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18940472 visited=false changed_operations=[22] opened_boundaries=[] 2026-09-13T09:46:02.836960Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.837285Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.837370Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.837673Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18794051 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:02.837705Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.837818Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.838384Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.839144Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[8] opened_boundaries=[] 2026-09-13T09:46:02.843497Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.843755Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.843827Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.844158Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.844284Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.844843Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.845445Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.845890Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.845994Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.846550Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.846569Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.846771Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.846903Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.847016Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.847504Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.847600Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.847674Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.848484Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.853329Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.853689Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.853783Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.854267Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.854447Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.855231Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.859612Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.859814Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.859867Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.860116Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.860194Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.860638Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.861616Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.861999Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.862116Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.862662Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.862844Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.863698Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.865833Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.866051Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.866104Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.866386Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.866488Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.866893Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.866940Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.867140Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.867287Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.867404Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.867411Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.867487Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.867852Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.867888Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.867971Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.868061Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.868596Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.868898Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.869046Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698074 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.881877Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.882171Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.882265Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.882641Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.882761Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.883134Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.883392Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.883428Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.883502Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.883867Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.883988Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.884590Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.887370Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.887640Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.887712Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.888052Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.888170Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.888773Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.901738Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699940 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:02.912835Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18700470 visited=false changed_operations=[43, 44] opened_boundaries=[399] 2026-09-13T09:46:02.916110Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689304 visited=false changed_operations=[45] opened_boundaries=[400] 2026-09-13T09:46:02.919978Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:02.923167Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.923330Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688845 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:02.923426Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.923507Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.923900Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.924019Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.925641Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.931595Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:02.940145Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18732743 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:02.941915Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.942089Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.942139Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.942391Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.942472Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.942877Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.943734Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.943992Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.944075Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.944432Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.944542Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.945133Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.949724Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:02.954795Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.958415Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.960637Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.960874Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.960940Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.961227Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.961324Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.961436Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.961652Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18794051 visited=false changed_operations=[16] opened_boundaries=[] 2026-09-13T09:46:02.961685Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.961760Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.961796Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.961859Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[8] opened_boundaries=[] 2026-09-13T09:46:02.962121Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.962256Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.962844Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.966534Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.966883Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.966987Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.967468Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.967636Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.968439Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.968494Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698074 visited=false changed_operations=[42] opened_boundaries=[] 2026-09-13T09:46:02.973281Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.973664Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.973768Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.973966Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.974245Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.974274Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.974325Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.974442Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.974683Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.974819Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.975293Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.975436Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.982718Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.982973Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.983050Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.983402Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.983521Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.984132Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:02.984582Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:02.992423Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:02.994898Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.995159Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.995251Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.995607Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.995716Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:02.996317Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.002320Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.002593Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.002671Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.003000Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.003021Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.003137Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.003284Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.003368Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.003719Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.003756Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.003835Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.004007Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.004288Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.004369Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.004458Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.004723Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.004839Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.005456Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.014409Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688845 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:03.015607Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699940 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:03.021604Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.021779Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.021835Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.021995Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.022071Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.022149Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.022388Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.022510Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.022568Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.022958Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.023084Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.023892Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.032627Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:03.038508Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18779633 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.044416Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.044684Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.044753Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.045074Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.045182Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.045743Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.051671Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.052050Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.052152Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.052653Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.052832Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.053665Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.054159Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:03.062352Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.063660Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.063876Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.063954Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.064248Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.064378Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.064882Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.067635Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:03.077740Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.084646Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.084941Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.084999Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.085014Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.085270Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.085357Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.085388Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.085502Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.085716Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.085835Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.086074Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.086448Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.087331Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.087585Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.087664Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.088007Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.088115Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.088721Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.089069Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:03.090026Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.090287Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.092717Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.093018Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.093037Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:03.093095Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.093498Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.093621Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.094237Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.102699Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.102956Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.103029Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.103386Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.103499Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.104087Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.106225Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688845 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:03.108541Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.108803Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.108883Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.109259Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.109379Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.109975Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.113360Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.113626Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.113699Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.114040Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.114156Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.114772Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.115565Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.118331Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18717028 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:03.118681Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.118948Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.119020Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.119406Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.119525Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.120103Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.123061Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.123256Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.123310Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.123560Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.123639Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.124056Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.130069Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.130311Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.130356Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.130434Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.130781Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.130895Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.131349Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.131508Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.131613Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.131687Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.131758Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.132034Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.132050Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.132116Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.132168Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.132517Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.132643Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.132778Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.133266Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.140744Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.141002Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.141070Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.141407Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.141526Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.142075Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.149558Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.149768Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.149820Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.150067Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.150151Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.150614Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.155166Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:03.156414Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.156797Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.156909Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.157430Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.157610Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.158322Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.158455Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.167689Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18779633 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.168851Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:03.171576Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.171847Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.171920Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.172297Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.172419Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.173002Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.173459Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.174427Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[355] 2026-09-13T09:46:03.184497Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:03.184541Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.193242Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18798263 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.197035Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.197302Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.197382Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.197712Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.197824Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.198424Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.203472Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.203651Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.203702Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.203939Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.204019Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.204456Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.205744Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.205924Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18717028 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:03.207378Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[44] opened_boundaries=[] 2026-09-13T09:46:03.208702Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688845 visited=false changed_operations=[43] opened_boundaries=[] 2026-09-13T09:46:03.208918Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.211617Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.211866Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.211939Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.212320Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.212439Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213017Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.213091Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213354Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213375Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213437Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213643Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213718Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213774Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.213889Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.214061Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.214174Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.214479Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.214755Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.225078Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.225521Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.225625Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.226156Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.226337Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.226989Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.227160Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.227359Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.227467Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.227950Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.228122Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.228941Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.235328Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.235727Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.235830Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.236332Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.236502Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.237314Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.239997Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.240290Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.240366Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.240712Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.240841Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.241421Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.241905Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.242282Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.242393Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.242889Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.243055Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.243870Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.245489Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.245800Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.245880Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.246228Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.246353Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.246897Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.247179Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20643605 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:03.250965Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:03.253690Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.254297Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.254495Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.254545Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.254816Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.254923Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.255365Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.260839Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.261118Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.261199Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.261585Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.261700Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.262318Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.264997Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[355] 2026-09-13T09:46:03.272258Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:03.286361Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:03.286544Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.286813Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.286886Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.287239Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.287363Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.287943Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.291637Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.292965Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.293145Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.293196Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.293449Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.293533Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.293946Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.294385Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.299361Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691607 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.303273Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.303460Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.303524Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.303751Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.303828Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.304243Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.307551Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18717028 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:03.307620Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.307891Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.307966Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.308332Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.308455Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.309054Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.310060Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:03.311860Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=24667253 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.315981Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18798263 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.316718Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.316890Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.317063Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.317274Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.317621Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.317730Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.318388Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.319711Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.327940Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.328228Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.328309Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.328724Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.328838Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.329458Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.335634Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.340680Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.340979Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.341052Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.341333Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.341421Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.341557Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.341626Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.341707Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.342092Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.342178Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.342229Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.342837Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.344147Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20176694 visited=false changed_operations=[15] opened_boundaries=[] 2026-09-13T09:46:03.345773Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.346022Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.346098Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.346447Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.346558Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.346864Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.347041Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.347090Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.347132Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.347333Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.347415Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.347815Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.349879Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.350140Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.350236Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.350594Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.350708Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.351321Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.353739Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693863 visited=false changed_operations=[0] opened_boundaries=[3] 2026-09-13T09:46:03.356784Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.357051Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.357130Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.357501Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.357612Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.358193Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.361221Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20643605 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:03.363340Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.363624Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.363696Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.364032Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.364149Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.364753Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.365371Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.365667Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.365743Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.366107Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.366240Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.366849Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.371390Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.371654Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.371733Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.372094Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.372223Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.372816Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.376333Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18745212 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:03.376659Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.376919Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.376995Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.377349Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.377468Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.378075Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.382970Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.383147Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.383196Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.383439Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.383522Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.383936Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.388506Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704138 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:03.394750Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=45476477 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.409109Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[17] opened_boundaries=[] 2026-09-13T09:46:03.416410Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.418834Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.419099Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.419182Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.419551Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.419665Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.420281Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.421510Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18717028 visited=false changed_operations=[37, 38] opened_boundaries=[387] 2026-09-13T09:46:03.423780Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691607 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.427425Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[44] opened_boundaries=[400] 2026-09-13T09:46:03.429711Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18798263 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.431090Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[3] 2026-09-13T09:46:03.439785Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[3] 2026-09-13T09:46:03.441935Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:03.443479Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.457507Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.463763Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.464060Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.464133Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.464487Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.464622Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.465183Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.475162Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.475497Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.475579Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.475946Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.476063Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.476664Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.477131Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.477422Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.477506Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.477873Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.477996Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.478379Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.478584Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.478632Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.478632Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.478868Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.478947Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.479361Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.479395Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.479588Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.479637Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.479873Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.479954Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.480060Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.480251Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.480310Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.480367Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.480650Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.480768Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.481373Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.489388Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.489667Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.489741Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.490099Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.490233Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.490833Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.493583Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.493836Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.493906Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494092Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494261Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494373Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494382Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494678Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494761Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494801Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.494951Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.495050Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495127Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495150Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495155Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495277Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495323Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495474Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495588Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495577Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495877Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495880Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.495952Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.496045Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.496166Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.496321Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.496439Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.496906Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.497034Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.502956Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.503247Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.503331Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.503670Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.503783Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.504407Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.508740Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.509110Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.509187Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.509613Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.509658Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18745212 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:03.509728Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.510373Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.523793Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691607 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.529122Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18798263 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.551608Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.551801Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.551853Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.552089Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.552165Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.552564Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.552588Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.553890Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18741637 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:03.556831Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.557022Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.557071Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.557313Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.557390Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.557779Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.559019Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=24667253 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.560017Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=45476477 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.564803Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.565710Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.569240Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19336967 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:03.574954Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699728 visited=false changed_operations=[38] opened_boundaries=[387] 2026-09-13T09:46:03.577571Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.587817Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704138 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:03.593265Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.593520Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.593592Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.593940Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.594073Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.594550Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.594682Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.594819Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.594894Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.595263Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.595382Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.595966Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.600263Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.600523Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.600596Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.600944Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.601075Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.601698Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.602803Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:03.607092Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691607 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.607159Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18798263 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.612686Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.612952Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.613024Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.613380Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.613495Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.614082Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.618275Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618417Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618530Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618550Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618628Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618773Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618792Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618851Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618895Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.618981Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.619093Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.619191Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.619320Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.619424Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.619610Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.619705Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.619900Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.620480Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.621484Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[17] opened_boundaries=[] 2026-09-13T09:46:03.628124Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.628314Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.628532Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.628876Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.628980Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.630053Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.630345Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.630423Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.630803Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.630924Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.631550Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.633606Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.633931Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.634061Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.634487Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.634623Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.634751Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.634928Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.634976Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.635229Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.635307Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.635373Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.635703Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.646159Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.646562Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.646666Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.647150Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.647338Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.648126Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.657524Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18741637 visited=false changed_operations=[1] opened_boundaries=[] 2026-09-13T09:46:03.678472Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.678726Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.679044Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.679120Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.679523Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.679654Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.680283Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.686979Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.687382Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.687494Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.688034Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.688219Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.689065Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.691935Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=24667253 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.694539Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=47177261 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.695649Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18798263 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.700587Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18699728 visited=false changed_operations=[38] opened_boundaries=[387] 2026-09-13T09:46:03.707769Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.708127Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.708231Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.708675Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.708830Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.709038Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[345] 2026-09-13T09:46:03.709125Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698160 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:03.709603Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.710417Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19336967 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:03.714388Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[17] opened_boundaries=[] 2026-09-13T09:46:03.716280Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.716590Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.716667Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.717053Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.717170Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.717811Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.725143Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691607 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.736182Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=24667253 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.742381Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.742657Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.742734Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.743088Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.743197Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.743816Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.747565Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.747825Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.747897Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.748252Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.748372Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.748960Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.751351Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.751622Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.751695Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.752055Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.752170Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.752769Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.755139Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:03.757217Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757355Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757575Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757615Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757678Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757689Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757705Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757980Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.757986Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.758051Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.758173Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.758358Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.758414Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.758524Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.758589Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.759107Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.759163Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.763369Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.763576Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.763645Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.763730Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.763740Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.763938Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.764079Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.764194Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.764300Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.764413Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.764816Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.765150Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.765408Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.765482Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.765798Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.765906Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.766493Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.769380Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.769642Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.769716Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.770079Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.770213Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.770816Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.790275Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19774097 visited=false changed_operations=[14] opened_boundaries=[] 2026-09-13T09:46:03.791415Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696350 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:03.809508Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[17] opened_boundaries=[] 2026-09-13T09:46:03.810783Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.811091Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.811173Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.811572Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.811691Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.812316Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.815090Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:03.817721Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=47177261 visited=false changed_operations=[12] opened_boundaries=[] 2026-09-13T09:46:03.825018Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19354247 visited=false changed_operations=[5] opened_boundaries=[] 2026-09-13T09:46:03.828260Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18838574 visited=false changed_operations=[17] opened_boundaries=[] 2026-09-13T09:46:03.830533Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18876023 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.833797Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698160 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:03.836340Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18691607 visited=false changed_operations=[45] opened_boundaries=[] 2026-09-13T09:46:03.836649Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.836915Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.836991Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.837361Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.837488Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.838083Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.839171Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.839580Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.839691Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.840079Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.840216Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.840809Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.848235Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[345] 2026-09-13T09:46:03.852926Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.853132Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.853185Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.853438Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.853517Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.853635Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18976031 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.853940Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.860419Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[345] 2026-09-13T09:46:03.868342Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.868593Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.868665Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.869037Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.869832Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.872279Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.872719Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.872818Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.873321Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.873501Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.873900Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.874178Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.874258Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.874293Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.874638Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.874755Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.875303Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.876673Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.877075Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.877181Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.877715Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.877887Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.878741Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.880369Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.880627Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1224, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 17, padding_groups: 1, block_size: 256, padding_multiple: 256, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.880913Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.881394Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.881570Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.896123Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:03.913872Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696350 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:03.914098Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:03.923410Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18976031 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.942022Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.942223Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.942280Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.942510Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.942585Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.942989Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.945032Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:03.953742Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18876023 visited=false changed_operations=[23] opened_boundaries=[] 2026-09-13T09:46:03.961112Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695331 visited=false changed_operations=[42, 43] opened_boundaries=[396] 2026-09-13T09:46:03.963717Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.964020Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.964097Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.964492Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.964609Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.965253Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.966142Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18838574 visited=false changed_operations=[17] opened_boundaries=[] 2026-09-13T09:46:03.974396Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.974751Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.974852Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.975371Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.975565Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.976420Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.989115Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.989401Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.989485Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.989831Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.989945Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.990561Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:03.991450Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18732743 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:03.994953Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.995231Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.995306Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.995568Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:03.995664Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.995774Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:03.996367Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.000720Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.000974Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.001046Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.001404Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.001536Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.002142Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.019492Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.019672Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.019727Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.019955Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.020029Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.020446Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.039024Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.039310Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.039385Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.039530Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:04.039755Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.039914Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.040594Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.061755Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688791 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:04.066967Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.067251Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.067330Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.067695Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.067815Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.067995Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.068433Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.069012Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18732743 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:04.070723Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.070999Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.071081Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.071461Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.071580Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.072185Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.073052Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19543895 visited=false changed_operations=[14] opened_boundaries=[355] 2026-09-13T09:46:04.078582Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.080739Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.080993Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.081067Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.081415Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.081529Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.082127Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.094387Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.094679Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.094756Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.095125Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.095252Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.095867Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.097314Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.097607Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.097683Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.098016Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.098131Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.098686Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.105120Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.105534Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.105640Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.106126Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.106315Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.107159Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.110303Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.110714Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.110820Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.111333Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.111525Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.112350Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.124435Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.124627Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.124673Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.124848Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.124879Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.124927Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.124955Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.125280Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.125339Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.125409Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.125470Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.126014Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.126081Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.149778Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696990 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:04.157816Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:04.162577Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:04.163092Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18694991 visited=false changed_operations=[2] opened_boundaries=[] 2026-09-13T09:46:04.179509Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[359] 2026-09-13T09:46:04.186343Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.186429Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.186601Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.186671Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.186996Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.187112Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.187672Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.193148Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.193432Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.193514Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.193858Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.193972Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.194587Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.196884Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:04.196997Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689391 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.201875Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:04.202889Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.203146Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.203239Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.203602Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.203721Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.204333Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.212354Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.212627Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.212700Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.213048Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.213164Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.213788Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.226473Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:04.237955Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.238255Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.238339Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.238703Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.238860Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.239622Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.242786Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.243240Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.243318Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.243670Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.243794Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.244413Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.256605Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:04.264370Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696990 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:04.265582Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:04.273581Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:04.282198Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18694991 visited=false changed_operations=[2] opened_boundaries=[] 2026-09-13T09:46:04.294542Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.294992Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.295066Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.295419Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.295532Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.296125Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.305600Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.305845Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.305921Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.306273Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.306385Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.306960Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.317034Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689391 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.318396Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.318668Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.318741Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.319083Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.319197Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.319516Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:04.319824Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.374354Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.374638Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.374717Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.375074Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.375190Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.375816Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.386323Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:04.387310Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688446 visited=false changed_operations=[2] opened_boundaries=[] 2026-09-13T09:46:04.388671Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688112 visited=false changed_operations=[25] opened_boundaries=[] 2026-09-13T09:46:04.417851Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.418057Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.418130Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.418418Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.418507Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.418930Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.424008Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.424286Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.424364Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.424715Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.424828Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.425441Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.429348Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.429605Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.429675Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.430015Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.430124Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.430721Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.435717Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.435974Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.436056Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.436419Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.436530Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.437123Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.446775Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689109 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:04.473515Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688446 visited=false changed_operations=[2] opened_boundaries=[] 2026-09-13T09:46:04.484701Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.484976Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.485054Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.485418Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.485536Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.486143Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.496781Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696670 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:04.502747Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688112 visited=false changed_operations=[25] opened_boundaries=[] 2026-09-13T09:46:04.504228Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.504462Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.504541Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.504821Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.504899Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.505370Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.511019Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38] opened_boundaries=[] 2026-09-13T09:46:04.540749Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.541003Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.541083Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.541436Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.541553Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.542147Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.543248Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.543500Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.543572Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.543919Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.544026Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.544628Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.545061Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.545246Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.545301Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.545542Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.545626Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.546045Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.551434Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.551684Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.551767Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.552115Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.552238Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.552911Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.558167Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.558690Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.558794Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.559325Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.559531Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.560409Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.561556Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18685423 visited=false changed_operations=[2] opened_boundaries=[] 2026-09-13T09:46:04.579911Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689109 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:04.598023Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.598309Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.598386Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.598755Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.598875Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.599497Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.611555Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.617838Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.618112Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.618193Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.618554Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.618673Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.619303Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.623505Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18696670 visited=false changed_operations=[1, 2] opened_boundaries=[4] 2026-09-13T09:46:04.639281Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688112 visited=false changed_operations=[25] opened_boundaries=[] 2026-09-13T09:46:04.640222Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.644652Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.653491Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.653741Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.653813Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.654160Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.654308Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.654915Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.672269Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[2] opened_boundaries=[] 2026-09-13T09:46:04.682757Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.683129Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.683254Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.683762Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.683931Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.684760Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.687996Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.688258Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.688339Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.688692Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.688809Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.689143Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.689422Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.689507Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.689614Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.690094Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.690267Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.690966Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.692797Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.715109Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.715387Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.715464Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.715835Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.715955Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.716570Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.724661Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.731936Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.732212Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.732296Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.732640Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.732757Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.733377Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.760376Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.766581Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.766696Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688112 visited=false changed_operations=[25] opened_boundaries=[] 2026-09-13T09:46:04.766827Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.766901Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.767257Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.767388Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.767981Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.777497Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.789573Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[2] opened_boundaries=[] 2026-09-13T09:46:04.809043Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.809326Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.809400Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.809750Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.809871Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.810495Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.814340Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.814617Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.814688Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.815035Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.815144Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.815743Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.817748Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.818147Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.818426Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.818507Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.818860Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.818981Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.819600Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.828916Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.829179Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.829269Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.829623Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.829740Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.830354Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.833650Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.833918Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.834001Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.834362Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.834469Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.835059Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.851284Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.860622Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.860891Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.860970Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.861338Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.861455Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.862066Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.881259Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.887977Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688446 visited=false changed_operations=[2] opened_boundaries=[4] 2026-09-13T09:46:04.894478Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.894739Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.894812Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.895162Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.895304Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.895908Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.898942Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695411 visited=false changed_operations=[25] opened_boundaries=[] 2026-09-13T09:46:04.904907Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[38] opened_boundaries=[388] 2026-09-13T09:46:04.905167Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:04.906261Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.906651Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.906770Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.907310Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.907487Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.908335Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.923082Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.923346Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.923419Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.923757Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.923879Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.924491Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.930985Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.931256Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.931332Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.931688Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.931803Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.932410Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.936104Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688165 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:04.939185Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.939456Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.939528Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.939875Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.939985Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.940597Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.945951Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.946222Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.946299Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.946651Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.946772Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.947384Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.949777Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.950030Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.950107Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.950475Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.950581Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.951174Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.965940Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.978548Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.978809Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.978893Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.979260Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.979378Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:04.979992Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:04.996811Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[372] 2026-09-13T09:46:04.999304Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[359] 2026-09-13T09:46:05.004338Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688446 visited=false changed_operations=[2] opened_boundaries=[4] 2026-09-13T09:46:05.019491Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:05.021283Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695411 visited=false changed_operations=[25] opened_boundaries=[] 2026-09-13T09:46:05.030499Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701229 visited=false changed_operations=[38] opened_boundaries=[388] 2026-09-13T09:46:05.035368Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.035544Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.035594Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.035784Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.036186Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.050588Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:05.055635Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.056049Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.056155Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.056699Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.056885Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.057732Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.060936Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.061184Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.061266Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.061692Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.061802Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.062288Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.062391Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.062561Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.062635Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.062991Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.063102Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.063706Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.067362Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688165 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:05.067911Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.068353Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.068447Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.069133Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.069370Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.070259Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.075575Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.075840Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.075923Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.076295Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.076402Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.076997Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.079894Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:05.083793Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18831770 visited=false changed_operations=[17, 18] opened_boundaries=[358] 2026-09-13T09:46:05.099568Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:05.108187Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.108378Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.108470Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.108740Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.108823Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.109242Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.120483Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.120871Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.120980Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.121510Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.121688Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.122666Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.129793Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19531691 visited=false changed_operations=[3, 4] opened_boundaries=[344] 2026-09-13T09:46:05.133914Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:05.139824Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[359] 2026-09-13T09:46:05.144835Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.145096Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.145172Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.145542Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.145648Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.146261Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.168569Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19531691 visited=false changed_operations=[3, 4] opened_boundaries=[344] 2026-09-13T09:46:05.168952Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.169177Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.169267Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.169525Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:05.169615Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.169731Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.170316Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.174304Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.174562Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.174641Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.174982Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.175090Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.175374Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688346 visited=false changed_operations=[3] opened_boundaries=[] 2026-09-13T09:46:05.175690Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.183027Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.183451Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.183556Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.184062Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.184251Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.184510Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.184873Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.185053Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.185083Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.186332Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.186525Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.187356Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.193430Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.194022Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.194226Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.195615Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.195935Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.197091Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.212575Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.212858Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.212962Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.213570Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.213683Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.213758Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.213795Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.213853Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.214125Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.214216Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.214393Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.214624Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.216730Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688165 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:05.224461Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.224724Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.224800Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.225143Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.225259Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.225854Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.256806Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:05.260536Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.260810Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.260901Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.261272Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.261390Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.261997Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.264286Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:05.266533Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:05.266888Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688346 visited=false changed_operations=[3] opened_boundaries=[] 2026-09-13T09:46:05.268419Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19333322 visited=false changed_operations=[3, 4] opened_boundaries=[344] 2026-09-13T09:46:05.282416Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.282785Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.282884Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.283677Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.283863Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.284696Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.286687Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19333322 visited=false changed_operations=[3, 4] opened_boundaries=[344] 2026-09-13T09:46:05.294734Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.294911Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.294980Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.295233Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.295314Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.295718Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.301870Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38, 45] opened_boundaries=[388] 2026-09-13T09:46:05.304813Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19333322 visited=false changed_operations=[3, 4] opened_boundaries=[344] 2026-09-13T09:46:05.307981Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308033Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308289Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308350Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308368Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308453Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308744Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308862Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.308894Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.309047Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.309484Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.309839Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.327367Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.327620Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.327700Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.328055Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.328168Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.328765Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.333174Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:05.336472Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688165 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:05.346552Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688346 visited=false changed_operations=[3] opened_boundaries=[] 2026-09-13T09:46:05.348669Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.348925Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.348999Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.349348Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.349455Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.350050Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.375076Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.375266Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.375331Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.375579Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.375671Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.376185Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.379119Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19333079 visited=false changed_operations=[4] opened_boundaries=[344] 2026-09-13T09:46:05.379227Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:05.381232Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.381564Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.381674Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.382153Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.382348Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.383115Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.386237Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:05.391704Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.392150Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.392278Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.392827Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.393043Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.393914Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.408494Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:05.429263Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.429500Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.429572Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.429912Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.430021Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.430607Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.436493Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688346 visited=false changed_operations=[3] opened_boundaries=[] 2026-09-13T09:46:05.444852Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.445109Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.445189Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.445562Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.445679Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.446297Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.448053Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38, 45] opened_boundaries=[388] 2026-09-13T09:46:05.463139Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.463423Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.463501Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.463867Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.463985Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.464620Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.464922Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.465096Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.465140Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.465370Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.465455Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.465846Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.469375Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.469752Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.469893Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.470884Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.471074Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.471928Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.473054Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:05.476855Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18687477 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:05.476922Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.477185Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.477273Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.477585Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.478180Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.498667Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:05.507100Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.507380Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.507459Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.507815Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.507927Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.508534Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.515722Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18885419 visited=false changed_operations=[3] opened_boundaries=[] 2026-09-13T09:46:05.518785Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[372] 2026-09-13T09:46:05.519388Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.519661Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.519740Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.520093Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.520230Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.520842Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.525946Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.526251Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.526335Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.526711Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.526848Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.527495Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.537932Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.538163Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.538256Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.538597Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.538706Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.539300Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.541119Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19503395 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:05.543192Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.543379Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.543419Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.543637Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.543717Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.544120Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.544630Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.544896Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.544971Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.545540Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.545662Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.546271Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.552020Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18831770 visited=false changed_operations=[17, 18] opened_boundaries=[358] 2026-09-13T09:46:05.560846Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.561099Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.561173Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.561552Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.561675Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.562287Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.576399Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19333322 visited=false changed_operations=[3, 4] opened_boundaries=[344] 2026-09-13T09:46:05.586220Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.586635Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.586737Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.587260Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.587438Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.588267Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.591043Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38, 45] opened_boundaries=[388] 2026-09-13T09:46:05.604081Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18687477 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:05.607287Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18885419 visited=false changed_operations=[3] opened_boundaries=[] 2026-09-13T09:46:05.608814Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:05.625198Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19333079 visited=false changed_operations=[4] opened_boundaries=[344] 2026-09-13T09:46:05.629064Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.629463Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:05.629467Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.629598Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.630091Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.630288Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.631123Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.636181Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.636327Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.636379Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.636434Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.636587Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.636664Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.636665Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.636746Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.637014Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.637121Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.637155Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.637726Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.642831Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[372] 2026-09-13T09:46:05.646794Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.647087Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.647165Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.647577Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.647719Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.648365Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.661792Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.662094Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.662170Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.662573Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.662736Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.663393Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.665601Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19503395 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:05.679289Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.679549Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.679641Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.679808Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 144, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.679997Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.680044Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.680119Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.680132Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.680488Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.680603Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.680731Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.681173Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.685769Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.686022Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.686096Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.686456Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.686579Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.687170Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.687712Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:05.703505Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[32] opened_boundaries=[377] 2026-09-13T09:46:05.711935Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18702981 visited=false changed_operations=[38, 45] opened_boundaries=[388] 2026-09-13T09:46:05.721938Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688483 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:05.732183Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.732467Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.732550Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.732919Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.733034Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.733657Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.734626Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:05.744846Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.745105Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.745176Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.745545Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.745676Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.746359Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.748693Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18743613 visited=false changed_operations=[26] opened_boundaries=[] 2026-09-13T09:46:05.750274Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:05.755332Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.755585Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.755662Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.756001Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.756104Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.756708Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.764924Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.765357Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.765470Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.766009Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.766224Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.767093Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.784414Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18736785 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:05.789956Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.790236Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:05.790417Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.790527Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.791093Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.791315Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.791977Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.794407Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.794553Z DEBUG considering direct FP8 output producer=Some(OperationId(39)) consumer=Some(OperationId(40)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.794757Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.794832Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.795151Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.795274Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.795871Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.812047Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.812400Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.812476Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.812830Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.812958Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.813564Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.816905Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:05.817614Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[30] opened_boundaries=[] 2026-09-13T09:46:05.820220Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.820493Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.820568Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.820781Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.820939Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821030Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821069Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821104Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821290Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821472Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821584Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821594Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821674Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.821696Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.822051Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.822160Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.822166Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.822751Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.824096Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.824408Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.824487Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.824885Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.825023Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.825680Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.831950Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.832220Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.832295Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.832639Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.832754Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.833361Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.833631Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688483 visited=false changed_operations=[28, 29] opened_boundaries=[376] 2026-09-13T09:46:05.834310Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.834574Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.834652Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.834989Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.835091Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.835696Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.843430Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.843560Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.843801Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.843875Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.843897Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.843975Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.844401Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.844474Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.844558Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.844630Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.845365Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.845419Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.858216Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.858258Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.858412Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:05.858497Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.858514Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.858573Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.858586Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.858925Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.858942Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.859041Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.859075Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.859663Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.859699Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.863310Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.863483Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695792 visited=false changed_operations=[39] opened_boundaries=[] 2026-09-13T09:46:05.863530Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.863587Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.863687Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:05.863866Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.863981Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.864518Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.882829Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:05.891219Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[350] 2026-09-13T09:46:05.900586Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[352] 2026-09-13T09:46:05.900638Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[350] 2026-09-13T09:46:05.901001Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[351] 2026-09-13T09:46:05.902991Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.903145Z DEBUG considering direct FP8 output producer=Some(OperationId(39)) consumer=Some(OperationId(40)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 4, padding_multiple: 4, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.903373Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.903444Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.903783Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.903893Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.904477Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.904676Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18736785 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:05.917714Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.918035Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.918112Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.918534Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.918697Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.918764Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18687477 visited=false changed_operations=[29] opened_boundaries=[376] 2026-09-13T09:46:05.919365Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.929453Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[30] opened_boundaries=[] 2026-09-13T09:46:05.934619Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:05.934704Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.934969Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.935043Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.935419Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.935543Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.936122Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.948874Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.949091Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.949145Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.949430Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.949554Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.949608Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.949880Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.949952Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.950006Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.950328Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.950452Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.951041Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.956503Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[352] 2026-09-13T09:46:05.957658Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.957919Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.957919Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[351] 2026-09-13T09:46:05.957992Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.958365Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.958488Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.959075Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.960705Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.960964Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.961038Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.961402Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.961531Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.962112Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.965800Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.966067Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.966142Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.966520Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.966648Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.967299Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.970127Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.970407Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.970479Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.970837Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.970972Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.971599Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.972127Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18695792 visited=false changed_operations=[39] opened_boundaries=[] 2026-09-13T09:46:05.977526Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.977781Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.977857Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.978218Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.978340Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:05.978937Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:05.992968Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22342445 visited=false changed_operations=[4] opened_boundaries=[] 2026-09-13T09:46:06.001936Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.002353Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.002461Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.002990Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.003162Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.003974Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.004919Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18687477 visited=false changed_operations=[29] opened_boundaries=[376] 2026-09-13T09:46:06.008091Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.008371Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.008442Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.008767Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.008877Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.009438Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.009483Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.011810Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.012118Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.012198Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.012576Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.012700Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.012787Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.013052Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.013123Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.013291Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.013413Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.013477Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.013602Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.014139Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.023005Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.023354Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.023435Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.023799Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.023911Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.024525Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.035058Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.041359Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=29221505 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:06.041816Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[382] 2026-09-13T09:46:06.046552Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.046847Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.046926Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.047351Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.047521Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.048165Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.049165Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.051518Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.051906Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.051990Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.052501Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.052716Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.053445Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.055330Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.055601Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.055653Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.055674Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.056034Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.056149Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.056755Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.061815Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688330 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.062084Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.062102Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.062371Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.062451Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.062866Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.062982Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.063583Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.066881Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[381] 2026-09-13T09:46:06.074320Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704231 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:06.084690Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.084967Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.085047Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.085465Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.085598Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.086246Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.086641Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19533635 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:06.086971Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18681299 visited=true changed_operations=[17, 18] opened_boundaries=[358] 2026-09-13T09:46:06.089764Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.090035Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.090111Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.090498Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.090625Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.090630Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.090898Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.090971Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.091252Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.091350Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.091491Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.092098Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.097239Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.097572Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.097614Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18681299 visited=false changed_operations=[17, 18] opened_boundaries=[358] 2026-09-13T09:46:06.097683Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.098153Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.098325Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.099113Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.100758Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.100939Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.100987Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.101243Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.101325Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109155Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109422Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109429Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109497Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109686Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109760Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109862Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.109984Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.110118Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.110130Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.110264Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.110415Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.110493Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.110601Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.110853Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.110858Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.110990Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.111618Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.114775Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.115044Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.115119Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.115491Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.115610Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.116223Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.122417Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704485 visited=false changed_operations=[29] opened_boundaries=[] 2026-09-13T09:46:06.125010Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701620 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.125982Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19533635 visited=false changed_operations=[19] opened_boundaries=[] 2026-09-13T09:46:06.126334Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.128257Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.128553Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.128630Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.128998Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.129117Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.129159Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.129747Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.135978Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18681299 visited=false changed_operations=[17, 18] opened_boundaries=[358] 2026-09-13T09:46:06.139226Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.139591Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.139666Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.140100Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.140322Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.141018Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.143487Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.143759Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.143834Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.144195Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.144349Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.144968Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.152976Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.153145Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.153193Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.153438Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.153514Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.161423Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18978709 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.161730Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.163529Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.163819Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.163897Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.164306Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.164456Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.165085Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:06.165096Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.166070Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.166346Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.166421Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.166779Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.166900Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.167492Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.176662Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.176919Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.176991Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.177072Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701620 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.177367Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.177479Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.178052Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.179835Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25581473 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:06.180012Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.180294Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.180374Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.180739Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.180727Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.180752Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[381] 2026-09-13T09:46:06.180855Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.181048Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.181145Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.181185Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.181458Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.181612Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.181780Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.182481Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.182586Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.182772Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.182854Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.183223Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.183340Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.183950Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.190352Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704231 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:06.202111Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202184Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202399Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202468Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202477Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202544Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202840Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202919Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.202960Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.203050Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.203583Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.203705Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.205614Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[31] opened_boundaries=[] 2026-09-13T09:46:06.205778Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.205937Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.205983Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.206217Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.206299Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.210921Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.211461Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.216855Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.217849Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.218132Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.218218Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.218584Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.218781Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.219610Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.220594Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.220956Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.221055Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.221574Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.221591Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.221708Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.221844Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.221961Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.222014Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.222064Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.222095Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.222565Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.222573Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.222720Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.222746Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.222808Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.223580Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.223690Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.234792Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701620 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.244158Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.254527Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.259593Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.259927Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.259923Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.260003Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.260164Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.260256Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.260455Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.260597Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.260645Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.260712Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.261300Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.261323Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.264071Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.266338Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704485 visited=false changed_operations=[29] opened_boundaries=[] 2026-09-13T09:46:06.268712Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.268893Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.268942Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.269170Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.269262Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.271469Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.271812Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.271887Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.272341Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.272524Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.273227Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.274367Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.283388Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.283415Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.283760Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.283798Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.283862Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.284378Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.284556Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.285395Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.286942Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.287228Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.287310Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.287655Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.287770Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.288368Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.290163Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.290179Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18978709 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.290849Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.291107Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.291178Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.291528Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.291653Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.292246Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.293875Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.294572Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18701620 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.301803Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25581473 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:06.303408Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.303600Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:06.304622Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.304798Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[31] opened_boundaries=[] 2026-09-13T09:46:06.304886Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.304966Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.305327Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.305445Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.306026Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.312897Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.313081Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.313131Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.313380Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.313460Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.315142Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.315452Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.315533Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.315933Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.316092Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.316745Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.323863Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324035Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324083Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324199Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324329Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324409Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324445Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324536Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324875Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.324984Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.325560Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.330973Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.331255Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.331333Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.331691Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.331816Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.332427Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.332436Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.332709Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.332975Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.333047Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.333415Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.333559Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.334194Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.339744Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18742828 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.341993Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.343543Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19576835 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.345319Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.345675Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.345755Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.346151Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.346339Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.346500Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.346769Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.346840Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.346997Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.347214Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.347362Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.347971Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.348276Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18742828 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.350082Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:06.355784Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.356049Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.356121Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.356497Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.356538Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.356633Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.356799Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.356879Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.357027Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.357251Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.357256Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.357387Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.357974Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.372479Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.372790Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.372863Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.373270Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.373470Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.374133Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.377515Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.377681Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.377729Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.377956Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.378038Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.379130Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704485 visited=false changed_operations=[29] opened_boundaries=[377] 2026-09-13T09:46:06.384341Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.384518Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.384571Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.384803Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.384882Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.386761Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704871 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:06.392024Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18687463 visited=false changed_operations=[29] opened_boundaries=[] 2026-09-13T09:46:06.392762Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.393105Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.393220Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.393693Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.393846Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.394649Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.397136Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.397405Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.397479Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.397834Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.397955Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.398557Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.398745Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.398991Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.399063Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.399420Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.399537Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.401753Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18742828 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.405923Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.409077Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19085908 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.410507Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689829 visited=false changed_operations=[41] opened_boundaries=[394] 2026-09-13T09:46:06.420002Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.420288Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.420363Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.420706Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.420821Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.421419Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.422129Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704871 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:06.427035Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22783355 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:06.430039Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:06.431124Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.431318Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.431368Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.431596Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.431680Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.432685Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689780 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:06.433026Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.433320Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.433408Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.433801Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.433945Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.434596Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.442249Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.442527Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.442599Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.443014Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.443142Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.443714Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.443792Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.446046Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.446534Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.446717Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.446765Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.446991Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.447071Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.449766Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.450018Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.450093Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.450481Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.450602Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.451199Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.453113Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.453401Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.453480Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.453855Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.453985Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.454609Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.457924Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18742828 visited=false changed_operations=[40, 41] opened_boundaries=[394] 2026-09-13T09:46:06.459786Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.459977Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460026Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460254Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460294Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460405Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460436Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460484Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460725Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460802Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.460824Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.464520Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.467267Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.472889Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689829 visited=false changed_operations=[41] opened_boundaries=[394] 2026-09-13T09:46:06.484273Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.484566Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.484640Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.485034Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.485188Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.485403Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689780 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:06.485837Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.494749Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704485 visited=false changed_operations=[29] opened_boundaries=[377] 2026-09-13T09:46:06.497998Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.498262Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.498337Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.498689Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.498807Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.499403Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.500351Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.500526Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.500574Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.500805Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.500892Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.502495Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.502837Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.502921Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.503367Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.503539Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.504358Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.507942Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.508313Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.508415Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.508623Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.508891Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.508928Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.509023Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.509057Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.509471Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.509641Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.509861Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.510420Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.512131Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22783355 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:06.514852Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29] opened_boundaries=[] 2026-09-13T09:46:06.517627Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.517877Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.517948Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.518290Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.518413Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.518642Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.519056Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.519164Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.519718Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.519893Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.520763Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.520820Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.521245Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.521357Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.521871Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.522068Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.522901Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.530054Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.530468Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.530571Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.531005Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18692833 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.531073Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19085908 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.531096Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.531318Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.532159Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.534427Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18692833 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.537028Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18921626 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:06.548554Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.548754Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.548803Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.549050Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.549146Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.549604Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.553762Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18921626 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:06.560474Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.560824Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.560899Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.561311Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.561435Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.562041Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.563510Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.563796Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.563881Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.564286Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.564439Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.564595Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.565076Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.569579Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.569940Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.570027Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.570496Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.570671Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.571244Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.571438Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.571495Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.571562Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.571878Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.572000Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.572224Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.572477Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.572550Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.572558Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.572908Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.573023Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.573810Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[382] 2026-09-13T09:46:06.574009Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.574291Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.574373Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.574723Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.574840Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.575453Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.586040Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29, 32] opened_boundaries=[377] 2026-09-13T09:46:06.586498Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688791 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:06.586621Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.588217Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.588565Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.588659Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.589132Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.589340Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.590130Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.595262Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.595591Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.595686Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.596121Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.596285Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.596784Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704551 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:06.601378Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19503395 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.602957Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19503395 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.608947Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18921626 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:06.616138Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.616480Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.616558Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.616960Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.617131Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.617806Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.625920Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.626161Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.626253Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.626591Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.626709Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.626735Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.626988Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.627062Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.627153Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.627300Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.627443Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.627559Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.628159Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.629763Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.630215Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.630293Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.630725Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.630865Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.631162Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.631388Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.631460Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.631492Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.631780Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.631922Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.632423Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.636396Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29] opened_boundaries=[] 2026-09-13T09:46:06.636945Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.637240Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.637321Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.637713Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.637867Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.638537Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.638624Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.638915Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.638992Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.639382Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.639533Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.640157Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.640999Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18687463 visited=true changed_operations=[29, 32] opened_boundaries=[377] 2026-09-13T09:46:06.644266Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29] opened_boundaries=[] 2026-09-13T09:46:06.649267Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.649526Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.649600Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.649953Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.649986Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18921626 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:06.650080Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.651492Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18704551 visited=false changed_operations=[27] opened_boundaries=[] 2026-09-13T09:46:06.652001Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19533635 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.664977Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.665159Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.665223Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.665468Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.665553Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.665977Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.667980Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.668273Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.668350Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.668730Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.668864Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.669485Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.681225Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18716353 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.686267Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.686439Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.686633Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.686731Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.686735Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.686829Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.687237Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.687264Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.687393Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.687456Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.688028Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18689822 visited=false changed_operations=[41] opened_boundaries=[] 2026-09-13T09:46:06.688060Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.688293Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.693996Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29, 32] opened_boundaries=[377] 2026-09-13T09:46:06.695793Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.695870Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18687463 visited=false changed_operations=[29, 32] opened_boundaries=[377] 2026-09-13T09:46:06.696077Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.696154Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.696351Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698566 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:06.696535Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.696676Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.697332Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.702909Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29, 32] opened_boundaries=[377] 2026-09-13T09:46:06.704511Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688791 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:06.704714Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.704980Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.705066Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.705458Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.705595Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.706239Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.707616Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.707878Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.707957Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.708316Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.708433Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.709031Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.710599Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688535 visited=false changed_operations=[37] opened_boundaries=[384] 2026-09-13T09:46:06.716171Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:06.719574Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.723966Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.724253Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.724335Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.724691Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.724817Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.725467Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.737886Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.738136Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.738228Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.738560Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.738677Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.739285Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.739838Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.740216Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.740309Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.740753Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.740862Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.740947Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.741671Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.747501Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.747908Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.748007Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.748305Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.748502Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.748505Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.748594Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.748687Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.748921Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.749038Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.749496Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.749628Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.761741Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.762149Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.762281Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.762827Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.763038Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.763949Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.768509Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19533635 visited=false changed_operations=[19] opened_boundaries=[360] 2026-09-13T09:46:06.775314Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.775606Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.775684Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.775744Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=36501596 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:06.776066Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.776217Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.776864Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.777487Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29] opened_boundaries=[] 2026-09-13T09:46:06.791120Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:06.795392Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18716353 visited=false changed_operations=[35] opened_boundaries=[] 2026-09-13T09:46:06.808591Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698566 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:06.818144Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:06.819213Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698566 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:06.825704Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688535 visited=false changed_operations=[37] opened_boundaries=[384] 2026-09-13T09:46:06.828392Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688791 visited=false changed_operations=[28] opened_boundaries=[] 2026-09-13T09:46:06.830335Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18703205 visited=false changed_operations=[29, 32] opened_boundaries=[377] 2026-09-13T09:46:06.844302Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.844469Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.844572Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.844648Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.844687Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.844738Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.844988Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.845001Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.845105Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.845110Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.845574Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.845730Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.848658Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.849018Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.849126Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.849625Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.849769Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.850187Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.850403Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.850468Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.850547Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.850637Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.850907Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.850913Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.850988Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.851051Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.851392Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.851529Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.851712Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.852163Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.853656Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:06.854591Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.854791Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.854840Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.855101Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.855224Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.855667Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.856794Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.856983Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.857037Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.857300Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.857388Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.857807Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.869809Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.870081Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.870164Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.870544Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.870665Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.871274Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:06.895035Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:06.904248Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688315 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:06.911048Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:06.917270Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18698566 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:06.924163Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:06.924275Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18739774 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:06.924428Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=36501596 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:06.941087Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[32] opened_boundaries=[377] 2026-09-13T09:46:06.998878Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.999225Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.999329Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:06.999830Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.000020Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.000852Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.006997Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.007280Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.007359Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.007683Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.007717Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.007853Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.007872Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.007921Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.008170Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.008281Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.008481Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.008613Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.008705Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.008790Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.008840Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.009071Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.009154Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.009562Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.010702Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.011058Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.011168Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.011676Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.011857Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.012703Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.016341Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.016597Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.016672Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.017029Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.017142Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.017524Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.017759Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.017781Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.017853Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.018266Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.018393Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.018989Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.056282Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:07.059945Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:07.078146Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688315 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:07.082387Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.082661Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.082746Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.083118Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.083343Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.083776Z DEBUG priced elementwise fusion source=Some(OperationId(20)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(14034) fused_cycles=Some(15726) 2026-09-13T09:46:07.084248Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.089863Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=29221505 visited=false changed_operations=[20] opened_boundaries=[] 2026-09-13T09:46:07.090024Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:07.094132Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.094424Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.094495Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.094866Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.095008Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.095595Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.096957Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:07.099528Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.099792Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.099861Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.100195Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.100324Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.100858Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.107774Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18739774 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:07.130715Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.130995Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.131075Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.131458Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.131597Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.132235Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.141236Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.141461Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.141519Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.141773Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.141873Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.142306Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.149531Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.149854Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.149946Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.150409Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.150565Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.151249Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.151733Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.152033Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.152120Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.152548Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.152674Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.153287Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.154316Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.154606Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.154680Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.155039Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.155177Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.155807Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.157854Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.158184Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.158294Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.158731Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.158912Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.159661Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.160156Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:07.162534Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:07.168853Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18969740 visited=false changed_operations=[20] opened_boundaries=[360] 2026-09-13T09:46:07.175941Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.176123Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.176175Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.176416Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.176565Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.176834Z DEBUG priced elementwise fusion source=Some(OperationId(20)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(14034) fused_cycles=Some(15726) 2026-09-13T09:46:07.177123Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.194482Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:07.202079Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688315 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:07.208000Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.208216Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.208268Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.208521Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.208621Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 448, padding_multiple: 448, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.209038Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.209616Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.209869Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.209944Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.210315Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.210437Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.211035Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.217123Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.217381Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.217458Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.217788Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.217895Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.218603Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.222183Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18681299 visited=true changed_operations=[18] opened_boundaries=[358] 2026-09-13T09:46:07.225189Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18969740 visited=false changed_operations=[20] opened_boundaries=[360] 2026-09-13T09:46:07.226600Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18681299 visited=false changed_operations=[18] opened_boundaries=[358] 2026-09-13T09:46:07.228596Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:07.238133Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18739774 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:07.243183Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.243470Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.243546Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.243922Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.244060Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.244688Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.256284Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25177877 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:07.262913Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.263162Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.263254Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.263590Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.263702Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.264300Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.277556Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.277805Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.277894Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.278246Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.278338Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.278357Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.278587Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.278663Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.278937Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.278995Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1470, replicas: 147, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 5, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.279098Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.279694Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.282089Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[362] 2026-09-13T09:46:07.289334Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:07.304473Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.304731Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.304804Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.305156Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.305298Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 32, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.306217Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.314150Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688315 visited=false changed_operations=[37] opened_boundaries=[] 2026-09-13T09:46:07.332950Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18739774 visited=false changed_operations=[40] opened_boundaries=[] 2026-09-13T09:46:07.347126Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:07.352291Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19920005 visited=false changed_operations=[18] opened_boundaries=[] 2026-09-13T09:46:07.365706Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.365976Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.366050Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.366419Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.366554Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 5, padding_groups: 1, block_size: 864, padding_multiple: 864, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.367153Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.380001Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20634371 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:07.432989Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.433276Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.433351Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.433703Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.433842Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 729, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 729, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 32, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.434764Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.443407Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=25034129 visited=false changed_operations=[21] opened_boundaries=[] 2026-09-13T09:46:07.462265Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.462550Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.462594Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.462629Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.462889Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.462969Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.463032Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.463240Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.463357Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.463489Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.463939Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.464124Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.508836Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=20634371 visited=false changed_operations=[] opened_boundaries=[] 2026-09-13T09:46:07.538913Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[362] 2026-09-13T09:46:07.542679Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[362] 2026-09-13T09:46:07.691634Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.691915Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.691985Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.692343Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.692484Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.693093Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.693915Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.694403Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.694524Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.695110Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.695392Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:07.696335Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:07.763880Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693377 visited=false changed_operations=[25, 26] opened_boundaries=[368] 2026-09-13T09:46:07.769192Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18693377 visited=false changed_operations=[25, 26] opened_boundaries=[368] 2026-09-13T09:46:08.316362Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.316752Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.316855Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.317373Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.317535Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.318374Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:08.408868Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18686069 visited=false changed_operations=[26] opened_boundaries=[368] 2026-09-13T09:46:08.535907Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.536109Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.536164Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.536412Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.536502Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.536914Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:08.546318Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.546861Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.546947Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.547324Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.547443Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.548109Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:08.550842Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:08.554232Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:08.554918Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.555219Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.555292Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.555620Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.555735Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.556285Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:08.566469Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.566872Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.566979Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.567512Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.567716Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:08.568577Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:08.598123Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18686078 visited=false changed_operations=[25, 26] opened_boundaries=[368] 2026-09-13T09:46:08.616524Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18686078 visited=false changed_operations=[25, 26] opened_boundaries=[368] 2026-09-13T09:46:08.637976Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18686078 visited=false changed_operations=[25, 26] opened_boundaries=[368] 2026-09-13T09:46:08.646297Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18686078 visited=false changed_operations=[25, 26] opened_boundaries=[368] 2026-09-13T09:46:11.581377Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.581577Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.581634Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.581865Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.581943Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.582359Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:11.593926Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.594372Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.594454Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.594871Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.595030Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.595658Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:11.644504Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=43460954 visited=false changed_operations=[20, 21] opened_boundaries=[361] 2026-09-13T09:46:11.683456Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=43460954 visited=false changed_operations=[20, 21] opened_boundaries=[361] 2026-09-13T09:46:11.712023Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.712224Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.712275Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.712514Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.712587Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.712983Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:11.727963Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.728268Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.728362Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.728711Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.728828Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:11.729436Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:11.761389Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=28074653 visited=false changed_operations=[20, 21] opened_boundaries=[361] 2026-09-13T09:46:11.802508Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=28074653 visited=false changed_operations=[20, 21] opened_boundaries=[361] 2026-09-13T09:46:12.075119Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075281Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075337Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075389Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075482Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075535Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075639Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075722Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075772Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.075848Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 24, axes: [AxisTiling { axis: FromEnd(1), partitions: 15, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 4, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.076141Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:12.076280Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:12.124908Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=36180863 visited=false changed_operations=[20, 21] opened_boundaries=[361] 2026-09-13T09:46:12.127367Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=36180863 visited=false changed_operations=[20, 21] opened_boundaries=[361] 2026-09-13T09:46:12.281632Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.281922Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.281999Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.282355Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.282470Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.283076Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:12.283550Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.283911Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.284009Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.284503Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.284657Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:12.285464Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:12.355676Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22783355 visited=false changed_operations=[20] opened_boundaries=[361] 2026-09-13T09:46:12.357246Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=22783355 visited=false changed_operations=[20] opened_boundaries=[361] 2026-09-13T09:46:13.237005Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.237346Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.237427Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.237805Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.237917Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.238552Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:13.239582Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.239896Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.239981Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.240407Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.240545Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.241143Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:13.313637Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[361] 2026-09-13T09:46:13.314116Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18688103 visited=false changed_operations=[] opened_boundaries=[361] 2026-09-13T09:46:13.370685Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 36, axes: [AxisTiling { axis: FromEnd(1), partitions: 4, padding_groups: 1, block_size: 288, padding_multiple: 288, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.371008Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.371083Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.371511Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.371675Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.372307Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:13.394322Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.394737Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.394840Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.395440Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 54, axes: [AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.395606Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:13.396703Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:13.398679Z DEBUG discarded invalid local recipe error=selected operator implementation is invalid 2026-09-13T09:46:13.453992Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18686069 visited=false changed_operations=[26] opened_boundaries=[368] 2026-09-13T09:46:13.478683Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=18681299 visited=true changed_operations=[17, 18] opened_boundaries=[358] 2026-09-13T09:46:14.621593Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.621881Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.621958Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.622336Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.622461Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.623042Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:14.694367Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19069343 visited=false changed_operations=[14] opened_boundaries=[354] 2026-09-13T09:46:14.825547Z DEBUG considering direct FP8 output producer=Some(OperationId(25)) consumer=Some(OperationId(26)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 18, axes: [AxisTiling { axis: FromEnd(1), partitions: 9, padding_groups: 1, block_size: 128, padding_multiple: 128, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.825929Z DEBUG considering direct FP8 output producer=Some(OperationId(42)) consumer=Some(OperationId(43)) kernel=Gelu input_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 20, padding_groups: 1, block_size: 224, padding_multiple: 224, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 1, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.826031Z DEBUG considering direct FP8 output producer=Some(OperationId(3)) consumer=Some(OperationId(4)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 183, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 183, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.826534Z DEBUG considering direct FP8 output producer=Some(OperationId(17)) consumer=Some(OperationId(18)) kernel=LayerNorm input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 27, axes: [AxisTiling { axis: FromEnd(1), partitions: 6, padding_groups: 1, block_size: 192, padding_multiple: 192, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 9, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.826726Z DEBUG considering direct FP8 output producer=Some(OperationId(20)) consumer=Some(OperationId(21)) kernel=Gelu input_layout=Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } output_layout=Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1458, replicas: 9, axes: [AxisTiling { axis: FromEnd(1), partitions: 27, padding_groups: 1, block_size: 160, padding_multiple: 160, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 6, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard } 2026-09-13T09:46:14.827527Z DEBUG priced elementwise fusion source=Some(OperationId(42)) kernel=Primitive(Compute { kernel: BiasGelu, operands: [OperandWindow([]), OperandWindow([])], product: None, output_aliases: [] }) separate_cycles=Some(1098) fused_cycles=Some(630) 2026-09-13T09:46:14.905372Z DEBUG screened local recipe incumbent_cycles=18688103 candidate_cycles=19069343 visited=false changed_operations=[14] opened_boundaries=[354] 2026-09-13T09:46:14.921744Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: evaluating ordered local candidates concurrently candidates=1 threads=24 2026-09-13T09:46:22.707508Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: screened exchange table geometry expansion_ms=6267 expansion_and_footprint_ms=7785 estimated_row_bytes=37592 heuristic_row_bytes=102580 geometry_fragments_per_tile=4307 fragment_limit=16384 2026-09-13T09:46:22.832851Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: eliminated unread FP8 cast input padding clears removed=612 2026-09-13T09:46:23.455257Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=48 2026-09-13T09:46:23.459647Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=54 2026-09-13T09:46:23.460583Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=55 2026-09-13T09:46:23.462999Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=49 2026-09-13T09:46:23.464680Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=52 2026-09-13T09:46:23.468550Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=7 2026-09-13T09:46:23.472894Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=53 2026-09-13T09:46:23.477618Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=50 2026-09-13T09:46:23.478381Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=50 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:46:23.478395Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=50 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.478644Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=32 2026-09-13T09:46:23.479198Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=32 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:46:23.479227Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=32 initial_horizon=2978 selected_horizon=2978 endpoint_lower_bound=2304 lower_bound_gap=674 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.481783Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=32 tile=13 row_words=21 horizon=2978 2026-09-13T09:46:23.482493Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=50 tile=866 row_words=10 horizon=471 2026-09-13T09:46:23.483399Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=40 2026-09-13T09:46:23.484093Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=40 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:46:23.484103Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=40 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.485722Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=56 2026-09-13T09:46:23.487679Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=40 tile=47 row_words=23 horizon=374 2026-09-13T09:46:23.489371Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=11 2026-09-13T09:46:23.490644Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=11 transfers=2913 maximum_identical_destinations=1 2026-09-13T09:46:23.490657Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=11 initial_horizon=3193 selected_horizon=3193 endpoint_lower_bound=1440 lower_bound_gap=1753 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.490868Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=42 2026-09-13T09:46:23.491500Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=42 transfers=1745 maximum_identical_destinations=1 2026-09-13T09:46:23.491515Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=42 initial_horizon=2165 selected_horizon=2165 endpoint_lower_bound=900 lower_bound_gap=1265 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.492427Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=51 2026-09-13T09:46:23.492948Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=51 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:46:23.492956Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=51 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.494351Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=41 2026-09-13T09:46:23.495356Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=51 tile=47 row_words=23 horizon=374 2026-09-13T09:46:23.495372Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=11 tile=248 row_words=21 horizon=3193 2026-09-13T09:46:23.495813Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=42 tile=6 row_words=44 horizon=2165 2026-09-13T09:46:23.498861Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=6 2026-09-13T09:46:23.507810Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=46 2026-09-13T09:46:23.508347Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=46 transfers=1152 maximum_identical_destinations=1 2026-09-13T09:46:23.508357Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=46 initial_horizon=5743 selected_horizon=5743 endpoint_lower_bound=5632 lower_bound_gap=111 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.509859Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=46 tile=79 row_words=46 horizon=5743 2026-09-13T09:46:23.514012Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=35 2026-09-13T09:46:23.515423Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=47 2026-09-13T09:46:23.516611Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=35 transfers=1296 maximum_identical_destinations=1 2026-09-13T09:46:23.516626Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=35 initial_horizon=4287 selected_horizon=4287 endpoint_lower_bound=4096 lower_bound_gap=191 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.522335Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=35 tile=1146 row_words=20 horizon=4287 2026-09-13T09:46:23.525730Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=63 2026-09-13T09:46:23.528853Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=45 2026-09-13T09:46:23.529075Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=33 2026-09-13T09:46:23.531179Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=64 2026-09-13T09:46:23.536553Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=27 2026-09-13T09:46:23.537631Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=27 transfers=2820 maximum_identical_destinations=1 2026-09-13T09:46:23.537645Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=27 initial_horizon=3578 selected_horizon=3578 endpoint_lower_bound=1076 lower_bound_gap=2502 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.541223Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=62 2026-09-13T09:46:23.541848Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=62 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:46:23.541858Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=62 initial_horizon=406 selected_horizon=406 endpoint_lower_bound=304 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.542665Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=27 tile=1452 row_words=15 horizon=3578 2026-09-13T09:46:23.545282Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=62 tile=47 row_words=25 horizon=406 2026-09-13T09:46:23.561830Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=57 2026-09-13T09:46:23.566320Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=57 transfers=9654 maximum_identical_destinations=1 2026-09-13T09:46:23.566333Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=57 initial_horizon=1690 selected_horizon=1690 endpoint_lower_bound=1280 lower_bound_gap=410 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.569714Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=38 2026-09-13T09:46:23.575326Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=39 2026-09-13T09:46:23.575819Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=39 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:46:23.575829Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=39 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.576026Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=57 tile=943 row_words=46 horizon=1690 2026-09-13T09:46:23.579982Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=39 tile=866 row_words=10 horizon=471 2026-09-13T09:46:23.584997Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=58 2026-09-13T09:46:23.585458Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=58 transfers=1288 maximum_identical_destinations=1 2026-09-13T09:46:23.585468Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=58 initial_horizon=326 selected_horizon=326 endpoint_lower_bound=224 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.588563Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=58 tile=89 row_words=15 horizon=326 2026-09-13T09:46:23.630601Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=61 2026-09-13T09:46:23.631250Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=61 transfers=1725 maximum_identical_destinations=1 2026-09-13T09:46:23.631263Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=61 initial_horizon=1112 selected_horizon=1112 endpoint_lower_bound=896 lower_bound_gap=216 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.634648Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=59 2026-09-13T09:46:23.635889Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=59 transfers=2151 maximum_identical_destinations=1 2026-09-13T09:46:23.635907Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=59 initial_horizon=172 selected_horizon=172 endpoint_lower_bound=64 lower_bound_gap=108 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.635933Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=61 tile=1357 row_words=14 horizon=1112 2026-09-13T09:46:23.641081Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=59 tile=1109 row_words=40 horizon=172 2026-09-13T09:46:23.668238Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=25 transfers=20982 maximum_identical_destinations=1 2026-09-13T09:46:23.668272Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=25 initial_horizon=3396 selected_horizon=3396 endpoint_lower_bound=2560 lower_bound_gap=836 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:23.681347Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=25 tile=1259 row_words=69 horizon=3396 2026-09-13T09:46:23.711353Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=17 2026-09-13T09:46:23.716341Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=17 transfers=11656 maximum_identical_destinations=1 2026-09-13T09:46:23.716357Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=17 initial_horizon=2617 selected_horizon=2617 endpoint_lower_bound=2304 lower_bound_gap=313 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.720108Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=21 2026-09-13T09:46:23.720602Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=21 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:46:23.720612Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=21 initial_horizon=2909 selected_horizon=2909 endpoint_lower_bound=2304 lower_bound_gap=605 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.723291Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=21 tile=22 row_words=23 horizon=2909 2026-09-13T09:46:23.723711Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=17 tile=21 row_words=159 horizon=2617 2026-09-13T09:46:23.732892Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=2 2026-09-13T09:46:23.738251Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=29 transfers=3096 maximum_identical_destinations=1 2026-09-13T09:46:23.738276Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=29 initial_horizon=9150 selected_horizon=9150 endpoint_lower_bound=5120 lower_bound_gap=4030 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:23.741439Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=2 transfers=16520 maximum_identical_destinations=1 2026-09-13T09:46:23.741454Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=2 initial_horizon=3661 selected_horizon=3661 endpoint_lower_bound=3040 lower_bound_gap=621 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.743520Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=44 2026-09-13T09:46:23.751666Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=29 tile=452 row_words=54 horizon=9150 2026-09-13T09:46:23.752020Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=44 transfers=12492 maximum_identical_destinations=1 2026-09-13T09:46:23.752036Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=44 initial_horizon=7065 selected_horizon=7065 endpoint_lower_bound=6756 lower_bound_gap=309 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.759514Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=2 tile=1061 row_words=90 horizon=3661 2026-09-13T09:46:23.769270Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=44 tile=64 row_words=135 horizon=7065 2026-09-13T09:46:23.813198Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=4 2026-09-13T09:46:23.817618Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=4 transfers=3650 maximum_identical_destinations=1 2026-09-13T09:46:23.817639Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=4 initial_horizon=1927 selected_horizon=1927 endpoint_lower_bound=1152 lower_bound_gap=775 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.825696Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=4 tile=21 row_words=25 horizon=1927 2026-09-13T09:46:23.885168Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: compared ordinary and paired exchange schedules phase=22 candidates=18 ordinary_horizon=2545 paired_horizon=2362 use_paired=false 2026-09-13T09:46:23.895193Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=22 transfers=1475 maximum_identical_destinations=1 2026-09-13T09:46:23.895235Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=22 initial_horizon=2545 selected_horizon=2545 endpoint_lower_bound=1728 lower_bound_gap=817 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:23.901351Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=22 tile=171 row_words=32 horizon=2545 2026-09-13T09:46:23.913601Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=19 2026-09-13T09:46:23.927374Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=19 transfers=20656 maximum_identical_destinations=1 2026-09-13T09:46:23.927402Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=19 initial_horizon=4485 selected_horizon=4485 endpoint_lower_bound=3648 lower_bound_gap=837 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:23.930445Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=24 transfers=9684 maximum_identical_destinations=1 2026-09-13T09:46:23.930478Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=24 initial_horizon=10556 selected_horizon=10556 endpoint_lower_bound=7680 lower_bound_gap=2876 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:23.962131Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=19 tile=535 row_words=106 horizon=4485 2026-09-13T09:46:23.970518Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=24 tile=535 row_words=149 horizon=10556 2026-09-13T09:46:24.078835Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=9 2026-09-13T09:46:24.081800Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=16 2026-09-13T09:46:24.099161Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=9 transfers=50544 maximum_identical_destinations=1 2026-09-13T09:46:24.099180Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=9 initial_horizon=9085 selected_horizon=9085 endpoint_lower_bound=7424 lower_bound_gap=1661 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:24.101435Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=16 transfers=50960 maximum_identical_destinations=1 2026-09-13T09:46:24.101449Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=16 initial_horizon=2673 selected_horizon=2673 endpoint_lower_bound=1960 lower_bound_gap=713 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:24.126368Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=16 tile=455 row_words=131 horizon=2673 2026-09-13T09:46:24.134942Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=9 tile=473 row_words=171 horizon=9085 2026-09-13T09:46:24.177950Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=36 2026-09-13T09:46:24.207699Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=36 transfers=45090 maximum_identical_destinations=1 2026-09-13T09:46:24.207733Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=36 initial_horizon=7433 selected_horizon=7433 endpoint_lower_bound=6048 lower_bound_gap=1385 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:24.249370Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=36 tile=1090 row_words=186 horizon=7433 2026-09-13T09:46:24.367535Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=60 2026-09-13T09:46:24.384456Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=60 transfers=1076 maximum_identical_destinations=1 2026-09-13T09:46:24.384478Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=60 initial_horizon=531 selected_horizon=531 endpoint_lower_bound=112 lower_bound_gap=419 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:24.397447Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=60 tile=1075 row_words=94 horizon=531 2026-09-13T09:46:24.528986Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=31 2026-09-13T09:46:24.549714Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=20 2026-09-13T09:46:24.579950Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=31 transfers=51925 maximum_identical_destinations=1 2026-09-13T09:46:24.579982Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=31 initial_horizon=822 selected_horizon=822 endpoint_lower_bound=576 lower_bound_gap=246 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:24.593929Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=20 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:46:24.593967Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=20 initial_horizon=850 selected_horizon=850 endpoint_lower_bound=576 lower_bound_gap=274 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:24.621919Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=31 tile=1095 row_words=136 horizon=822 2026-09-13T09:46:24.656081Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=20 tile=356 row_words=177 horizon=850 2026-09-13T09:46:24.810291Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: compared ordinary and paired exchange schedules phase=23 candidates=2187 ordinary_horizon=16242 paired_horizon=11597 use_paired=false 2026-09-13T09:46:24.851123Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=23 transfers=2187 maximum_identical_destinations=1 2026-09-13T09:46:24.851174Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=23 initial_horizon=16242 selected_horizon=16242 endpoint_lower_bound=15744 lower_bound_gap=498 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:24.870317Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=23 tile=720 row_words=180 horizon=16242 2026-09-13T09:46:24.895840Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=15 2026-09-13T09:46:24.961728Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=15 transfers=71104 maximum_identical_destinations=1 2026-09-13T09:46:24.961758Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=15 initial_horizon=11776 selected_horizon=11776 endpoint_lower_bound=8768 lower_bound_gap=3008 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:25.002558Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=15 tile=79 row_words=272 horizon=11776 2026-09-13T09:46:25.123123Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=18 2026-09-13T09:46:25.165276Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=18 transfers=8388 maximum_identical_destinations=1 2026-09-13T09:46:25.165305Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=18 initial_horizon=5369 selected_horizon=5369 endpoint_lower_bound=4656 lower_bound_gap=713 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:25.198355Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=18 tile=36 row_words=354 horizon=5369 2026-09-13T09:46:25.451608Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=43 2026-09-13T09:46:25.500986Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=43 transfers=69906 maximum_identical_destinations=1 2026-09-13T09:46:25.501019Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=43 initial_horizon=5521 selected_horizon=5521 endpoint_lower_bound=2816 lower_bound_gap=2705 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:25.562377Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=43 tile=97 row_words=502 horizon=5521 2026-09-13T09:46:25.562871Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=28 2026-09-13T09:46:25.613123Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=28 transfers=21111 maximum_identical_destinations=1 2026-09-13T09:46:25.613155Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=28 initial_horizon=10169 selected_horizon=10169 endpoint_lower_bound=9760 lower_bound_gap=409 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:25.656670Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=28 tile=481 row_words=518 horizon=10169 2026-09-13T09:46:25.677584Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=14 transfers=66320 maximum_identical_destinations=1 2026-09-13T09:46:25.677617Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=14 initial_horizon=7135 selected_horizon=7135 endpoint_lower_bound=3240 lower_bound_gap=3895 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:25.728084Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=14 tile=964 row_words=285 horizon=7135 2026-09-13T09:46:26.191126Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=3 2026-09-13T09:46:26.192148Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=37 2026-09-13T09:46:26.218954Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=3 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:46:26.218982Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=3 initial_horizon=846 selected_horizon=846 endpoint_lower_bound=576 lower_bound_gap=270 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:26.246447Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=37 transfers=103635 maximum_identical_destinations=1 2026-09-13T09:46:26.246470Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=37 initial_horizon=1463 selected_horizon=1463 endpoint_lower_bound=1152 lower_bound_gap=311 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:26.264682Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=3 tile=356 row_words=177 horizon=846 2026-09-13T09:46:26.344431Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=37 tile=235 row_words=253 horizon=1463 2026-09-13T09:46:26.715885Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=13 2026-09-13T09:46:26.803606Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=13 transfers=33676 maximum_identical_destinations=1 2026-09-13T09:46:26.803650Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=13 initial_horizon=12868 selected_horizon=12868 endpoint_lower_bound=11940 lower_bound_gap=928 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:26.877551Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=13 tile=79 row_words=628 horizon=12868 2026-09-13T09:46:27.638337Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=34 2026-09-13T09:46:27.675905Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=34 transfers=6561 maximum_identical_destinations=1 2026-09-13T09:46:27.675936Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=34 initial_horizon=7906 selected_horizon=7906 endpoint_lower_bound=5248 lower_bound_gap=2658 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:27.698883Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=34 tile=263 row_words=258 horizon=7906 2026-09-13T09:46:27.762137Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=26 transfers=194092 maximum_identical_destinations=1 2026-09-13T09:46:27.762171Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=26 initial_horizon=2824 selected_horizon=2824 endpoint_lower_bound=2152 lower_bound_gap=672 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:27.836683Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=30 transfers=112284 maximum_identical_destinations=1 2026-09-13T09:46:27.836721Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=30 initial_horizon=14301 selected_horizon=14301 endpoint_lower_bound=9072 lower_bound_gap=5229 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:27.952296Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=30 tile=707 row_words=445 horizon=14301 2026-09-13T09:46:27.957247Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=26 tile=80 row_words=405 horizon=2824 2026-09-13T09:46:27.981531Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=5 2026-09-13T09:46:28.598860Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=0 2026-09-13T09:46:28.619839Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=0 transfers=2421 maximum_identical_destinations=1 2026-09-13T09:46:28.619866Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=0 initial_horizon=6634 selected_horizon=6634 endpoint_lower_bound=2944 lower_bound_gap=3690 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:28.635130Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=0 tile=359 row_words=389 horizon=6634 2026-09-13T09:46:28.717979Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=12 2026-09-13T09:46:28.789522Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=12 transfers=128094 maximum_identical_destinations=1 2026-09-13T09:46:28.789550Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=12 initial_horizon=4502 selected_horizon=4502 endpoint_lower_bound=1440 lower_bound_gap=3062 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:28.918956Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=12 tile=454 row_words=620 horizon=4502 2026-09-13T09:46:29.114162Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=10 2026-09-13T09:46:29.193770Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=10 transfers=155252 maximum_identical_destinations=1 2026-09-13T09:46:29.193803Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=10 initial_horizon=2258 selected_horizon=2258 endpoint_lower_bound=1728 lower_bound_gap=530 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:29.309924Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=10 tile=231 row_words=310 horizon=2258 2026-09-13T09:46:29.359418Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: reused exchange optimization after validating relocated rows phase=1 2026-09-13T09:46:29.363070Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=1 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:46:29.363093Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=1 initial_horizon=703 selected_horizon=703 endpoint_lower_bound=512 lower_bound_gap=191 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:29.370259Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=1 tile=1109 row_words=14 horizon=703 2026-09-13T09:46:32.520870Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: compared ordinary and paired exchange schedules phase=8 candidates=6588 ordinary_horizon=17260 paired_horizon=25623 use_paired=false 2026-09-13T09:46:32.664784Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: prepared large physical exchange phase phase=8 transfers=9180 maximum_identical_destinations=1 2026-09-13T09:46:32.664817Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: optimized physical exchange schedule phase=8 initial_horizon=17260 selected_horizon=17260 endpoint_lower_bound=9856 lower_bound_gap=7404 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:32.727019Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: finished large physical exchange phase phase=8 tile=104 row_words=649 horizon=17260 2026-09-13T09:46:32.809788Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="plan_kernels"}: package build phase finished phase="plan_kernels" elapsed_ms=73 success=true 2026-09-13T09:46:32.814261Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="compile_kernels"}: package build phase finished phase="compile_kernels" elapsed_ms=4 success=true 2026-09-13T09:46:32.821418Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="link_runtime"}: package build phase finished phase="link_runtime" elapsed_ms=0 success=true 2026-09-13T09:46:33.272188Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: exchange table and repeat patch storage exchange_table_bytes=27524 maximum_uncompressed_repeat_patch_bytes=1404 maximum_elided_arithmetic_patch_bytes=1404 2026-09-13T09:46:36.055991Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="size_tile_code"}: package build phase finished phase="size_tile_code" elapsed_ms=45 success=true 2026-09-13T09:46:36.056043Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: placing generated tile programs linked_end=385008 host_code_base=385008 host_code_bytes=8892 generated_code_bytes=9824 exchange_table_bytes=27524 executable_ranges=[(377220, 377224), (378228, 378232), (380284, 380288), (384028, 384032), (393968, 524288)] 2026-09-13T09:46:36.056058Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: allocated package support memory linked_end=385008 profile_bytes=0 exchange_table_bytes=27524 host_code_bytes=8892 host_data_bytes=6148 generated_code_bytes=9824 code_address=393968 available_ranges=[(327680, 360448), (368356, 376832), (442368, 949168)] 2026-09-13T09:46:36.660411Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="place_storage"}: package build phase finished phase="place_storage" elapsed_ms=604 success=true 2026-09-13T09:46:36.706344Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=48 2026-09-13T09:46:36.713475Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=47 2026-09-13T09:46:36.714729Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=7 2026-09-13T09:46:36.718415Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=49 2026-09-13T09:46:36.718669Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=40 2026-09-13T09:46:36.719364Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=40 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:46:36.719379Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=40 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.721799Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=5 2026-09-13T09:46:36.722248Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=40 tile=47 row_words=23 horizon=374 2026-09-13T09:46:36.726884Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=32 2026-09-13T09:46:36.727788Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=32 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:46:36.727805Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=32 initial_horizon=2978 selected_horizon=2978 endpoint_lower_bound=2304 lower_bound_gap=674 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.728389Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=41 2026-09-13T09:46:36.728526Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=4 2026-09-13T09:46:36.728726Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=46 2026-09-13T09:46:36.729568Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=46 transfers=1152 maximum_identical_destinations=1 2026-09-13T09:46:36.729589Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=46 initial_horizon=5743 selected_horizon=5743 endpoint_lower_bound=5632 lower_bound_gap=111 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.729630Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=4 transfers=3650 maximum_identical_destinations=1 2026-09-13T09:46:36.729639Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=4 initial_horizon=1927 selected_horizon=1927 endpoint_lower_bound=1152 lower_bound_gap=775 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.731214Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=1 2026-09-13T09:46:36.732279Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=46 tile=79 row_words=46 horizon=5743 2026-09-13T09:46:36.732308Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=1 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:46:36.732321Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=1 initial_horizon=703 selected_horizon=703 endpoint_lower_bound=512 lower_bound_gap=191 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.732473Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=32 tile=13 row_words=21 horizon=2978 2026-09-13T09:46:36.733616Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=4 tile=21 row_words=25 horizon=1927 2026-09-13T09:46:36.736400Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=1 tile=1109 row_words=14 horizon=703 2026-09-13T09:46:36.737065Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=50 2026-09-13T09:46:36.737643Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=50 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:46:36.737656Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=50 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.741717Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=21 2026-09-13T09:46:36.742272Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=21 transfers=1457 maximum_identical_destinations=1 2026-09-13T09:46:36.742281Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=21 initial_horizon=2909 selected_horizon=2909 endpoint_lower_bound=2304 lower_bound_gap=605 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.742443Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=50 tile=866 row_words=10 horizon=471 2026-09-13T09:46:36.745104Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=21 tile=22 row_words=23 horizon=2909 2026-09-13T09:46:36.746698Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=42 2026-09-13T09:46:36.747378Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=42 transfers=1745 maximum_identical_destinations=1 2026-09-13T09:46:36.747391Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=42 initial_horizon=2165 selected_horizon=2165 endpoint_lower_bound=900 lower_bound_gap=1265 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.751837Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=42 tile=6 row_words=44 horizon=2165 2026-09-13T09:46:36.753902Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=51 2026-09-13T09:46:36.754384Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=51 transfers=1224 maximum_identical_destinations=1 2026-09-13T09:46:36.754398Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=51 initial_horizon=374 selected_horizon=374 endpoint_lower_bound=272 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.757194Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=51 tile=47 row_words=23 horizon=374 2026-09-13T09:46:36.761977Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=6 2026-09-13T09:46:36.762986Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=52 2026-09-13T09:46:36.769443Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=53 2026-09-13T09:46:36.771129Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=54 2026-09-13T09:46:36.771926Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=55 2026-09-13T09:46:36.782566Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=38 2026-09-13T09:46:36.788658Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=27 2026-09-13T09:46:36.789793Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=27 transfers=2820 maximum_identical_destinations=1 2026-09-13T09:46:36.789808Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=27 initial_horizon=3578 selected_horizon=3578 endpoint_lower_bound=1076 lower_bound_gap=2502 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.795011Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=27 tile=1452 row_words=15 horizon=3578 2026-09-13T09:46:36.797874Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=39 2026-09-13T09:46:36.798415Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=39 transfers=1294 maximum_identical_destinations=1 2026-09-13T09:46:36.798426Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=39 initial_horizon=471 selected_horizon=471 endpoint_lower_bound=256 lower_bound_gap=215 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.802296Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=39 tile=866 row_words=10 horizon=471 2026-09-13T09:46:36.803991Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=56 2026-09-13T09:46:36.809762Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=33 2026-09-13T09:46:36.820706Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=35 2026-09-13T09:46:36.823103Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=35 transfers=1296 maximum_identical_destinations=1 2026-09-13T09:46:36.823118Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=35 initial_horizon=4287 selected_horizon=4287 endpoint_lower_bound=4096 lower_bound_gap=191 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.827420Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=35 tile=1146 row_words=20 horizon=4287 2026-09-13T09:46:36.867911Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=22 2026-09-13T09:46:36.869886Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=11 2026-09-13T09:46:36.871050Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=11 transfers=2913 maximum_identical_destinations=1 2026-09-13T09:46:36.871063Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=11 initial_horizon=3193 selected_horizon=3193 endpoint_lower_bound=1440 lower_bound_gap=1753 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.873131Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=22 transfers=1475 maximum_identical_destinations=1 2026-09-13T09:46:36.873146Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=22 initial_horizon=2545 selected_horizon=2545 endpoint_lower_bound=1728 lower_bound_gap=817 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.875813Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=11 tile=248 row_words=21 horizon=3193 2026-09-13T09:46:36.876128Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=44 2026-09-13T09:46:36.882730Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=22 tile=171 row_words=32 horizon=2545 2026-09-13T09:46:36.883927Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=44 transfers=12492 maximum_identical_destinations=1 2026-09-13T09:46:36.883958Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=44 initial_horizon=7065 selected_horizon=7065 endpoint_lower_bound=6756 lower_bound_gap=309 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.885993Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=45 2026-09-13T09:46:36.893895Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=57 2026-09-13T09:46:36.899551Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=44 tile=64 row_words=135 horizon=7065 2026-09-13T09:46:36.899769Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=57 transfers=9654 maximum_identical_destinations=1 2026-09-13T09:46:36.899782Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=57 initial_horizon=1690 selected_horizon=1690 endpoint_lower_bound=1280 lower_bound_gap=410 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.913282Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=58 2026-09-13T09:46:36.913452Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=57 tile=943 row_words=46 horizon=1690 2026-09-13T09:46:36.913830Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=58 transfers=1288 maximum_identical_destinations=1 2026-09-13T09:46:36.913841Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=58 initial_horizon=326 selected_horizon=326 endpoint_lower_bound=224 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.916551Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=58 tile=89 row_words=15 horizon=326 2026-09-13T09:46:36.918314Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=62 2026-09-13T09:46:36.918839Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=62 transfers=1368 maximum_identical_destinations=1 2026-09-13T09:46:36.918848Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=62 initial_horizon=406 selected_horizon=406 endpoint_lower_bound=304 lower_bound_gap=102 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.921635Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=62 tile=47 row_words=25 horizon=406 2026-09-13T09:46:36.926739Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=63 2026-09-13T09:46:36.932189Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=64 2026-09-13T09:46:36.932716Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=61 2026-09-13T09:46:36.933387Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=61 transfers=1725 maximum_identical_destinations=1 2026-09-13T09:46:36.933404Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=61 initial_horizon=1112 selected_horizon=1112 endpoint_lower_bound=896 lower_bound_gap=216 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.937529Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=61 tile=1357 row_words=14 horizon=1112 2026-09-13T09:46:36.941911Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=29 transfers=3096 maximum_identical_destinations=1 2026-09-13T09:46:36.941941Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=29 initial_horizon=8353 selected_horizon=8353 endpoint_lower_bound=5120 lower_bound_gap=3233 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:36.948595Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=59 2026-09-13T09:46:36.949668Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=59 transfers=2151 maximum_identical_destinations=1 2026-09-13T09:46:36.949687Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=59 initial_horizon=172 selected_horizon=172 endpoint_lower_bound=64 lower_bound_gap=108 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:36.954457Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=29 tile=1424 row_words=52 horizon=8353 2026-09-13T09:46:36.954845Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=59 tile=1109 row_words=40 horizon=172 2026-09-13T09:46:37.123701Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=17 2026-09-13T09:46:37.132031Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=17 transfers=11656 maximum_identical_destinations=1 2026-09-13T09:46:37.132065Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=17 initial_horizon=2617 selected_horizon=2617 endpoint_lower_bound=2304 lower_bound_gap=313 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.142924Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=17 tile=21 row_words=159 horizon=2617 2026-09-13T09:46:37.225551Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=19 2026-09-13T09:46:37.236097Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=19 transfers=20656 maximum_identical_destinations=1 2026-09-13T09:46:37.236122Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=19 initial_horizon=4485 selected_horizon=4485 endpoint_lower_bound=3648 lower_bound_gap=837 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.262425Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=19 tile=535 row_words=106 horizon=4485 2026-09-13T09:46:37.341486Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=9 2026-09-13T09:46:37.356402Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=23 2026-09-13T09:46:37.374659Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=9 transfers=50544 maximum_identical_destinations=1 2026-09-13T09:46:37.374687Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=9 initial_horizon=9085 selected_horizon=9085 endpoint_lower_bound=7424 lower_bound_gap=1661 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.383390Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=23 transfers=2187 maximum_identical_destinations=1 2026-09-13T09:46:37.383413Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=23 initial_horizon=16242 selected_horizon=16242 endpoint_lower_bound=15744 lower_bound_gap=498 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.398995Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=23 tile=720 row_words=180 horizon=16242 2026-09-13T09:46:37.419860Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=9 tile=473 row_words=171 horizon=9085 2026-09-13T09:46:37.447971Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=16 2026-09-13T09:46:37.455795Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=36 2026-09-13T09:46:37.476725Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=16 transfers=50960 maximum_identical_destinations=1 2026-09-13T09:46:37.476758Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=16 initial_horizon=2673 selected_horizon=2673 endpoint_lower_bound=1960 lower_bound_gap=713 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.480523Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=36 transfers=45090 maximum_identical_destinations=1 2026-09-13T09:46:37.480543Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=36 initial_horizon=7433 selected_horizon=7433 endpoint_lower_bound=6048 lower_bound_gap=1385 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.514134Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=16 tile=455 row_words=131 horizon=2673 2026-09-13T09:46:37.517640Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=24 transfers=9684 maximum_identical_destinations=1 2026-09-13T09:46:37.517672Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=24 initial_horizon=8787 selected_horizon=8787 endpoint_lower_bound=7680 lower_bound_gap=1107 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:37.523625Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=36 tile=1090 row_words=186 horizon=7433 2026-09-13T09:46:37.549900Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=31 2026-09-13T09:46:37.555160Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=24 tile=960 row_words=146 horizon=8787 2026-09-13T09:46:37.572667Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=31 transfers=51925 maximum_identical_destinations=1 2026-09-13T09:46:37.572687Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=31 initial_horizon=822 selected_horizon=822 endpoint_lower_bound=576 lower_bound_gap=246 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.603140Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=31 tile=1095 row_words=136 horizon=822 2026-09-13T09:46:37.653847Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=60 2026-09-13T09:46:37.676001Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=60 transfers=1076 maximum_identical_destinations=1 2026-09-13T09:46:37.676039Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=60 initial_horizon=531 selected_horizon=531 endpoint_lower_bound=112 lower_bound_gap=419 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:37.690308Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=60 tile=1075 row_words=94 horizon=531 2026-09-13T09:46:37.924793Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=20 2026-09-13T09:46:37.982042Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=20 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:46:37.982078Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=20 initial_horizon=850 selected_horizon=850 endpoint_lower_bound=576 lower_bound_gap=274 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:38.030304Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=20 tile=356 row_words=177 horizon=850 2026-09-13T09:46:38.096691Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=34 2026-09-13T09:46:38.136675Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=34 transfers=6561 maximum_identical_destinations=1 2026-09-13T09:46:38.136733Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=34 initial_horizon=7906 selected_horizon=7906 endpoint_lower_bound=5248 lower_bound_gap=2658 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:38.167155Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=34 tile=263 row_words=258 horizon=7906 2026-09-13T09:46:38.248550Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=15 2026-09-13T09:46:38.340516Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=15 transfers=71104 maximum_identical_destinations=1 2026-09-13T09:46:38.340550Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=15 initial_horizon=11776 selected_horizon=11776 endpoint_lower_bound=8768 lower_bound_gap=3008 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:38.386436Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=15 tile=79 row_words=272 horizon=11776 2026-09-13T09:46:38.445828Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=18 2026-09-13T09:46:38.495699Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=18 transfers=8388 maximum_identical_destinations=1 2026-09-13T09:46:38.495745Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=18 initial_horizon=5369 selected_horizon=5369 endpoint_lower_bound=4656 lower_bound_gap=713 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:38.550665Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=18 tile=36 row_words=354 horizon=5369 2026-09-13T09:46:38.995523Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=37 2026-09-13T09:46:39.056858Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=37 transfers=103635 maximum_identical_destinations=1 2026-09-13T09:46:39.056910Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=37 initial_horizon=1463 selected_horizon=1463 endpoint_lower_bound=1152 lower_bound_gap=311 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:39.122975Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=0 2026-09-13T09:46:39.149355Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=0 transfers=2421 maximum_identical_destinations=1 2026-09-13T09:46:39.149392Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=0 initial_horizon=6634 selected_horizon=6634 endpoint_lower_bound=2944 lower_bound_gap=3690 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:39.159160Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=43 2026-09-13T09:46:39.175173Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=0 tile=359 row_words=389 horizon=6634 2026-09-13T09:46:39.184715Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=37 tile=235 row_words=253 horizon=1463 2026-09-13T09:46:39.196827Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=43 transfers=69906 maximum_identical_destinations=1 2026-09-13T09:46:39.196850Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=43 initial_horizon=5521 selected_horizon=5521 endpoint_lower_bound=2816 lower_bound_gap=2705 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:39.243096Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=43 tile=97 row_words=502 horizon=5521 2026-09-13T09:46:39.319614Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=14 transfers=66320 maximum_identical_destinations=1 2026-09-13T09:46:39.319684Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=14 initial_horizon=7003 selected_horizon=7003 endpoint_lower_bound=3240 lower_bound_gap=3763 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:39.367134Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=14 tile=322 row_words=279 horizon=7003 2026-09-13T09:46:39.497965Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=25 2026-09-13T09:46:39.508647Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=25 transfers=20982 maximum_identical_destinations=1 2026-09-13T09:46:39.508670Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=25 initial_horizon=3396 selected_horizon=3396 endpoint_lower_bound=2560 lower_bound_gap=836 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:39.523238Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=25 tile=1259 row_words=69 horizon=3396 2026-09-13T09:46:39.616586Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=2 2026-09-13T09:46:39.625099Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=2 transfers=16520 maximum_identical_destinations=1 2026-09-13T09:46:39.625119Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=2 initial_horizon=3661 selected_horizon=3661 endpoint_lower_bound=3040 lower_bound_gap=621 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:39.639599Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=2 tile=1061 row_words=90 horizon=3661 2026-09-13T09:46:39.860009Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=10 2026-09-13T09:46:39.906817Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=13 2026-09-13T09:46:39.936005Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=10 transfers=155252 maximum_identical_destinations=1 2026-09-13T09:46:39.936032Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=10 initial_horizon=2258 selected_horizon=2258 endpoint_lower_bound=1728 lower_bound_gap=530 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:39.967009Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=13 transfers=33676 maximum_identical_destinations=1 2026-09-13T09:46:39.967043Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=13 initial_horizon=12868 selected_horizon=12868 endpoint_lower_bound=11940 lower_bound_gap=928 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:40.022354Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=13 tile=79 row_words=628 horizon=12868 2026-09-13T09:46:40.071096Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=10 tile=231 row_words=310 horizon=2258 2026-09-13T09:46:40.412941Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=3 2026-09-13T09:46:40.445805Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=3 transfers=51948 maximum_identical_destinations=1 2026-09-13T09:46:40.445837Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=3 initial_horizon=846 selected_horizon=846 endpoint_lower_bound=576 lower_bound_gap=270 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:40.508945Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=3 tile=356 row_words=177 horizon=846 2026-09-13T09:46:40.712575Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=12 2026-09-13T09:46:40.767625Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=30 transfers=112284 maximum_identical_destinations=1 2026-09-13T09:46:40.767665Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=30 initial_horizon=10541 selected_horizon=10541 endpoint_lower_bound=9072 lower_bound_gap=1469 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:40.771848Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=12 transfers=128094 maximum_identical_destinations=1 2026-09-13T09:46:40.771876Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=12 initial_horizon=4502 selected_horizon=4502 endpoint_lower_bound=1440 lower_bound_gap=3062 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:40.860514Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=12 tile=454 row_words=620 horizon=4502 2026-09-13T09:46:40.875285Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=30 tile=704 row_words=423 horizon=10541 2026-09-13T09:46:40.903312Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=26 2026-09-13T09:46:41.028652Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=26 transfers=194092 maximum_identical_destinations=1 2026-09-13T09:46:41.028688Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=26 initial_horizon=2824 selected_horizon=2824 endpoint_lower_bound=2152 lower_bound_gap=672 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:41.247115Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=26 tile=80 row_words=405 horizon=2824 2026-09-13T09:46:41.344296Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: reused exchange optimization after validating relocated rows phase=28 2026-09-13T09:46:41.383600Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=28 transfers=21111 maximum_identical_destinations=1 2026-09-13T09:46:41.383629Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=28 initial_horizon=10169 selected_horizon=10169 endpoint_lower_bound=9760 lower_bound_gap=409 selected_kind="reused" neighborhood_improvements=0 2026-09-13T09:46:41.417303Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=28 tile=481 row_words=518 horizon=10169 2026-09-13T09:46:45.086088Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: compared ordinary and paired exchange schedules phase=8 candidates=6588 ordinary_horizon=14880 paired_horizon=24695 use_paired=false 2026-09-13T09:46:45.189739Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: prepared large physical exchange phase phase=8 transfers=9180 maximum_identical_destinations=1 2026-09-13T09:46:45.189771Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: optimized physical exchange schedule phase=8 initial_horizon=14880 selected_horizon=14880 endpoint_lower_bound=9856 lower_bound_gap=5024 selected_kind="balanced-compact-streams" neighborhood_improvements=0 2026-09-13T09:46:45.233297Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: finished large physical exchange phase phase=8 tile=45 row_words=644 horizon=14880 2026-09-13T09:46:45.240407Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="lower_exchanges"}: package build phase finished phase="lower_exchanges" elapsed_ms=8579 success=true 2026-09-13T09:46:57.446281Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="optimize_exchange_placement"}: package build phase finished phase="optimize_exchange_placement" elapsed_ms=12205 success=true 2026-09-13T09:46:57.484324Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: costed final placed program final_cycles=11994090 final_exchange=4934192 2026-09-13T09:46:59.242290Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="prepare_tile_code"}: package build phase finished phase="prepare_tile_code" elapsed_ms=92 success=true 2026-09-13T09:46:59.354232Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="emit_tile_code"}: package build phase finished phase="emit_tile_code" elapsed_ms=111 success=true 2026-09-13T09:46:59.977949Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}:ipu_codegen.package.phase{phase="build_tile_images"}: package build phase finished phase="build_tile_images" elapsed_ms=574 success=true 2026-09-13T09:47:00.294311Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}:local_candidate{attempt=63}: retained faster incumbent candidate_cycles=11994090 cycles=11763240 2026-09-13T09:47:01.464850Z INFO ipu_codegen.package.build{tile_count=1472 operations=25}:ipu_codegen.package.phase{phase="plan_package"}: package build phase finished phase="plan_package" elapsed_ms=106059 success=true 2026-09-13T09:47:02.106558Z INFO writing application package tiles=1472 2026-09-13T09:47:02.199036Z INFO application package written 2026-09-13T09:47:02.199159Z INFO reading application package 2026-09-13T09:47:02.408347Z INFO application package read tiles=1472 compiler=0.1.0 exchangeRows=87770 counts=[send, sendoff, sendpic, sendpicp, standaloneControl, unknown]=[1426181, 293281, 1534712, 135426, 4015213, 5502] longest=[(658, 2691, 26, 424328, [244, 0, 239, 8, 63, 0]), (645, 2689, 722, 424632, [244, 1, 225, 8, 63, 0]), (644, 14498, 1408, 411496, [38, 22, 50, 172, 148, 0]), (644, 14497, 1410, 411616, [38, 24, 55, 172, 142, 0]), (644, 2694, 671, 425232, [244, 2, 221, 7, 69, 0]), (639, 14498, 384, 411552, [38, 12, 24, 203, 111, 0]), (638, 14494, 1409, 411488, [38, 18, 51, 176, 136, 0]), (637, 14618, 390, 411400, [38, 30, 19, 216, 83, 0]), (637, 14617, 388, 411400, [38, 32, 19, 216, 84, 0]), (637, 14497, 386, 411520, [38, 11, 15, 203, 120, 0]), (636, 14495, 1411, 411504, [38, 16, 51, 172, 146, 0]), (636, 2687, 182, 421864, [238, 2, 217, 11, 66, 0]), (633, 14623, 387, 411616, [38, 14, 13, 216, 92, 0]), (633, 14622, 385, 411584, [38, 12, 9, 216, 95, 0]), (630, 2677, 878, 422008, [238, 1, 237, 5, 51, 0]), (628, 12443, 387, 418248, [77, 37, 72, 77, 264, 0])]