2026-09-09T12:28:57.016549Z DEBUG retained planning beam operation=0 retained=34 expanded=34 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=16896 generated_plan_sets=1 plan_cache_hits=0 2026-09-09T12:28:57.027432Z DEBUG retained planning beam operation=0 retained=34 expanded=34 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=16896 generated_plan_sets=1 plan_cache_hits=0 2026-09-09T12:28:57.027547Z DEBUG retained planning beam operation=0 retained=34 expanded=34 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=16896 generated_plan_sets=1 plan_cache_hits=0 2026-09-09T12:28:57.027550Z DEBUG retained planning beam operation=0 retained=34 expanded=34 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=16896 generated_plan_sets=1 plan_cache_hits=0 2026-09-09T12:28:57.779765Z DEBUG retained planning beam operation=1 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=63 best_cycles=33792 generated_plan_sets=1 plan_cache_hits=33 2026-09-09T12:28:57.798329Z DEBUG retained planning beam operation=1 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=63 best_cycles=33792 generated_plan_sets=1 plan_cache_hits=33 2026-09-09T12:28:57.816804Z DEBUG retained planning beam operation=1 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=63 best_cycles=33792 generated_plan_sets=1 plan_cache_hits=33 2026-09-09T12:28:57.839003Z DEBUG retained planning beam operation=1 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=63 best_cycles=33792 generated_plan_sets=1 plan_cache_hits=33 2026-09-09T12:28:58.478950Z DEBUG retained planning beam operation=2 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=48 best_cycles=50688 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:58.492028Z DEBUG retained planning beam operation=3 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=53827 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.493648Z DEBUG retained planning beam operation=2 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=48 best_cycles=50688 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:58.493822Z DEBUG retained planning beam operation=2 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=48 best_cycles=50688 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:58.506661Z DEBUG retained planning beam operation=3 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=53827 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.506663Z DEBUG retained planning beam operation=3 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=53827 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.506785Z DEBUG retained planning beam operation=4 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=63050 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.521861Z DEBUG retained planning beam operation=4 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=63050 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.522000Z DEBUG retained planning beam operation=5 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=74852 generated_plan_sets=7 plan_cache_hits=57 2026-09-09T12:28:58.523078Z DEBUG retained planning beam operation=2 retained=64 expanded=128 pareto_dominated=0 equivalent=0 diversity_representatives=48 best_cycles=50688 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:58.523082Z DEBUG retained planning beam operation=4 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=63050 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.536511Z DEBUG retained planning beam operation=3 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=53827 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.536843Z DEBUG retained planning beam operation=5 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=74852 generated_plan_sets=7 plan_cache_hits=57 2026-09-09T12:28:58.536843Z DEBUG retained planning beam operation=5 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=74852 generated_plan_sets=7 plan_cache_hits=57 2026-09-09T12:28:58.562380Z DEBUG retained planning beam operation=4 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=63050 generated_plan_sets=5 plan_cache_hits=59 2026-09-09T12:28:58.572998Z DEBUG retained planning beam operation=5 retained=64 expanded=64 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=74852 generated_plan_sets=7 plan_cache_hits=57 2026-09-09T12:28:58.755075Z DEBUG retained planning beam operation=6 retained=29 expanded=30 pareto_dominated=1 equivalent=0 diversity_representatives=0 best_cycles=435598 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:58.755334Z DEBUG retained planning beam operation=6 retained=29 expanded=30 pareto_dominated=1 equivalent=0 diversity_representatives=0 best_cycles=435598 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:58.771851Z INFO retained operator-plan finalist finalist=0 values=11 operations=7 estimated_cycles=435598 estimated_exchange_cycles=189672 exchange_row_bytes=39788 peak_standard_bytes=205676 peak_interleaved_bytes=53504 peak_total_bytes=238444 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:58.771888Z DEBUG retained operator-plan details finalist=0 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[] 2026-09-09T12:28:58.772235Z INFO retained operator-plan finalist finalist=0 values=11 operations=7 estimated_cycles=435598 estimated_exchange_cycles=189672 exchange_row_bytes=39788 peak_standard_bytes=205676 peak_interleaved_bytes=53504 peak_total_bytes=238444 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:58.772266Z DEBUG retained operator-plan details finalist=0 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[] 2026-09-09T12:28:58.793435Z INFO retained operator-plan finalist finalist=1 values=12 operations=8 estimated_cycles=436564 estimated_exchange_cycles=193928 exchange_row_bytes=41228 peak_standard_bytes=207116 peak_interleaved_bytes=51200 peak_total_bytes=237836 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 720, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(2))] 2026-09-09T12:28:58.793456Z DEBUG retained operator-plan details finalist=1 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[(Some(OperationId(2)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951)] 2026-09-09T12:28:58.793792Z INFO retained operator-plan finalist finalist=1 values=12 operations=8 estimated_cycles=436564 estimated_exchange_cycles=193928 exchange_row_bytes=41228 peak_standard_bytes=207116 peak_interleaved_bytes=51200 peak_total_bytes=237836 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 720, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(2))] 2026-09-09T12:28:58.793807Z DEBUG retained operator-plan details finalist=1 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[(Some(OperationId(2)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951)] 2026-09-09T12:28:58.802025Z INFO retained operator-plan finalist finalist=2 values=13 operations=9 estimated_cycles=437506 estimated_exchange_cycles=189672 exchange_row_bytes=39788 peak_standard_bytes=205676 peak_interleaved_bytes=46592 peak_total_bytes=238444 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:58.802038Z DEBUG retained operator-plan details finalist=2 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0)] 2026-09-09T12:28:58.802394Z INFO retained operator-plan finalist finalist=2 values=13 operations=9 estimated_cycles=437506 estimated_exchange_cycles=189672 exchange_row_bytes=39788 peak_standard_bytes=205676 peak_interleaved_bytes=46592 peak_total_bytes=238444 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:58.802409Z DEBUG retained operator-plan details finalist=2 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0)] 2026-09-09T12:28:58.823459Z INFO retained operator-plan finalist finalist=3 values=13 operations=9 estimated_cycles=448120 estimated_exchange_cycles=198888 exchange_row_bytes=42380 peak_standard_bytes=208268 peak_interleaved_bytes=46336 peak_total_bytes=238988 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 460, 1380, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:58.823473Z DEBUG retained operator-plan details finalist=3 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 21278, 7376), (Some(OperationId(1)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(2)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0)] 2026-09-09T12:28:58.823856Z INFO retained operator-plan finalist finalist=3 values=13 operations=9 estimated_cycles=448120 estimated_exchange_cycles=198888 exchange_row_bytes=42380 peak_standard_bytes=208268 peak_interleaved_bytes=46336 peak_total_bytes=238988 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 460, 1380, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:58.823870Z DEBUG retained operator-plan details finalist=3 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 21278, 7376), (Some(OperationId(1)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(2)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0)] 2026-09-09T12:28:58.843579Z INFO retained operator-plan finalist finalist=4 values=11 operations=7 estimated_cycles=456670 estimated_exchange_cycles=190472 exchange_row_bytes=39968 peak_standard_bytes=205856 peak_interleaved_bytes=60416 peak_total_bytes=236576 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 720, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:58.843593Z DEBUG retained operator-plan details finalist=4 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[] 2026-09-09T12:28:58.843982Z INFO retained operator-plan finalist finalist=4 values=11 operations=7 estimated_cycles=456670 estimated_exchange_cycles=190472 exchange_row_bytes=39968 peak_standard_bytes=205856 peak_interleaved_bytes=60416 peak_total_bytes=236576 maximum_standard_allocation_bytes=122880 active_tile_counts={192, 720, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:58.843993Z DEBUG retained operator-plan details finalist=4 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: None, probability_value: None, materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 385496, 179160)] conversions=[] 2026-09-09T12:28:58.845732Z INFO retained operator-plan finalist finalist=5 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.845742Z DEBUG retained operator-plan details finalist=5 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:58.846135Z INFO retained operator-plan finalist finalist=5 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.846145Z DEBUG retained operator-plan details finalist=5 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:58.867121Z INFO retained operator-plan finalist finalist=6 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.867136Z DEBUG retained operator-plan details finalist=6 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)] 2026-09-09T12:28:58.867555Z INFO retained operator-plan finalist finalist=6 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.867575Z DEBUG retained operator-plan details finalist=6 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)] 2026-09-09T12:28:58.888523Z INFO retained operator-plan finalist finalist=7 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 512, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.888537Z DEBUG retained operator-plan details finalist=7 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540)] 2026-09-09T12:28:58.888953Z INFO retained operator-plan finalist finalist=7 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 512, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.888968Z DEBUG retained operator-plan details finalist=7 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540)] 2026-09-09T12:28:58.909909Z INFO retained operator-plan finalist finalist=8 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 256, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.909922Z DEBUG retained operator-plan details finalist=8 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540)] 2026-09-09T12:28:58.910371Z INFO retained operator-plan finalist finalist=8 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 256, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.910386Z DEBUG retained operator-plan details finalist=8 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540)] 2026-09-09T12:28:58.931314Z INFO retained operator-plan finalist finalist=9 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={128, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.931329Z DEBUG retained operator-plan details finalist=9 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:58.931779Z INFO retained operator-plan finalist finalist=9 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={128, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.931792Z DEBUG retained operator-plan details finalist=9 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:58.952704Z INFO retained operator-plan finalist finalist=10 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={64, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.952721Z DEBUG retained operator-plan details finalist=10 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:58.953185Z INFO retained operator-plan finalist finalist=10 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={64, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.953217Z DEBUG retained operator-plan details finalist=10 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:58.978370Z INFO retained operator-plan finalist finalist=11 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={32, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.978415Z DEBUG retained operator-plan details finalist=11 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:58.980140Z INFO retained operator-plan finalist finalist=11 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={32, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:58.980193Z DEBUG retained operator-plan details finalist=11 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.001667Z INFO retained operator-plan finalist finalist=12 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={16, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.001700Z DEBUG retained operator-plan details finalist=12 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.002889Z INFO retained operator-plan finalist finalist=12 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={16, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.002925Z DEBUG retained operator-plan details finalist=12 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.023108Z INFO retained operator-plan finalist finalist=13 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.023122Z DEBUG retained operator-plan details finalist=13 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:59.024325Z INFO retained operator-plan finalist finalist=13 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.024338Z DEBUG retained operator-plan details finalist=13 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:59.044521Z INFO retained operator-plan finalist finalist=14 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.044541Z DEBUG retained operator-plan details finalist=14 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)] 2026-09-09T12:28:59.045739Z INFO retained operator-plan finalist finalist=14 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.045759Z DEBUG retained operator-plan details finalist=14 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)] 2026-09-09T12:28:59.065936Z INFO retained operator-plan finalist finalist=15 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 512, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.065950Z DEBUG retained operator-plan details finalist=15 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540)] 2026-09-09T12:28:59.067156Z INFO retained operator-plan finalist finalist=15 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 512, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.067171Z DEBUG retained operator-plan details finalist=15 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540)] 2026-09-09T12:28:59.425855Z DEBUG retained planning beam operation=6 retained=30 expanded=30 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=218624 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:59.442619Z INFO retained operator-plan finalist finalist=0 values=11 operations=7 estimated_cycles=218624 estimated_exchange_cycles=104512 exchange_row_bytes=19972 peak_standard_bytes=167428 peak_interleaved_bytes=53504 peak_total_bytes=218628 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:59.442655Z DEBUG retained operator-plan details finalist=0 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[] 2026-09-09T12:28:59.447742Z DEBUG retained planning beam operation=6 retained=30 expanded=30 pareto_dominated=0 equivalent=0 diversity_representatives=0 best_cycles=218624 generated_plan_sets=1 plan_cache_hits=63 2026-09-09T12:28:59.468517Z INFO retained operator-plan finalist finalist=1 values=12 operations=8 estimated_cycles=219590 estimated_exchange_cycles=108768 exchange_row_bytes=21412 peak_standard_bytes=126820 peak_interleaved_bytes=51200 peak_total_bytes=171172 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 720, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(2))] 2026-09-09T12:28:59.468551Z DEBUG retained operator-plan details finalist=1 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(2)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951)] 2026-09-09T12:28:59.470925Z INFO retained operator-plan finalist finalist=0 values=11 operations=7 estimated_cycles=218624 estimated_exchange_cycles=104512 exchange_row_bytes=19972 peak_standard_bytes=167428 peak_interleaved_bytes=53504 peak_total_bytes=218628 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:59.470977Z DEBUG retained operator-plan details finalist=0 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[] 2026-09-09T12:28:59.477142Z INFO retained operator-plan finalist finalist=2 values=13 operations=9 estimated_cycles=220532 estimated_exchange_cycles=104512 exchange_row_bytes=19972 peak_standard_bytes=185860 peak_interleaved_bytes=48128 peak_total_bytes=218628 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:59.477157Z DEBUG retained operator-plan details finalist=2 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0)] 2026-09-09T12:28:59.492447Z INFO retained operator-plan finalist finalist=1 values=12 operations=8 estimated_cycles=219590 estimated_exchange_cycles=108768 exchange_row_bytes=21412 peak_standard_bytes=126820 peak_interleaved_bytes=51200 peak_total_bytes=171172 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 720, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(2))] 2026-09-09T12:28:59.492464Z DEBUG retained operator-plan details finalist=1 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(2)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951)] 2026-09-09T12:28:59.498588Z INFO retained operator-plan finalist finalist=3 values=13 operations=9 estimated_cycles=225747 estimated_exchange_cycles=112064 exchange_row_bytes=22636 peak_standard_bytes=177196 peak_interleaved_bytes=48128 peak_total_bytes=214444 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 720, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:59.498603Z DEBUG retained operator-plan details finalist=3 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(1)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951), (Some(OperationId(2)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951)] 2026-09-09T12:28:59.501010Z INFO retained operator-plan finalist finalist=2 values=13 operations=9 estimated_cycles=220532 estimated_exchange_cycles=104512 exchange_row_bytes=19972 peak_standard_bytes=185860 peak_interleaved_bytes=48128 peak_total_bytes=218628 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:59.501026Z DEBUG retained operator-plan details finalist=2 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0)] 2026-09-09T12:28:59.513559Z INFO retained operator-plan finalist finalist=4 values=13 operations=9 estimated_cycles=231146 estimated_exchange_cycles=113728 exchange_row_bytes=22564 peak_standard_bytes=182308 peak_interleaved_bytes=48128 peak_total_bytes=215076 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 460, 1380, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:59.513574Z DEBUG retained operator-plan details finalist=4 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 21278, 7376), (Some(OperationId(1)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(2)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0)] 2026-09-09T12:28:59.522372Z INFO retained operator-plan finalist finalist=3 values=13 operations=9 estimated_cycles=225747 estimated_exchange_cycles=112064 exchange_row_bytes=22636 peak_standard_bytes=177196 peak_interleaved_bytes=48128 peak_total_bytes=214444 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 720, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:59.522385Z DEBUG retained operator-plan details finalist=3 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(1)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951), (Some(OperationId(2)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 12531755484857033, 2305843009213693951)] 2026-09-09T12:28:59.533585Z INFO retained operator-plan finalist finalist=5 values=11 operations=7 estimated_cycles=239696 estimated_exchange_cycles=105312 exchange_row_bytes=20152 peak_standard_bytes=90040 peak_interleaved_bytes=60416 peak_total_bytes=129976 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 720, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:59.533599Z DEBUG retained operator-plan details finalist=5 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[] 2026-09-09T12:28:59.535752Z INFO retained operator-plan finalist finalist=6 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.535764Z DEBUG retained operator-plan details finalist=6 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:59.537374Z INFO retained operator-plan finalist finalist=4 values=13 operations=9 estimated_cycles=231146 estimated_exchange_cycles=113728 exchange_row_bytes=22564 peak_standard_bytes=182308 peak_interleaved_bytes=48128 peak_total_bytes=215076 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 460, 1380, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2))] 2026-09-09T12:28:59.537394Z DEBUG retained operator-plan details finalist=4 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 21278, 7376), (Some(OperationId(1)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(2)), BlockedGemm { inner_block: 384, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 10, column_partitions: 46, inner_partitions: 3, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1380, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 20006, 7376), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 460, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 384, column_block: 16 }), tiling: TensorTiling { tile_count: 1380, replicas: 10, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 3, padding_groups: 1, block_size: 384, padding_multiple: 384, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1127, 0)] 2026-09-09T12:28:59.557105Z INFO retained operator-plan finalist finalist=7 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.557119Z DEBUG retained operator-plan details finalist=7 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)] 2026-09-09T12:28:59.557461Z INFO retained operator-plan finalist finalist=5 values=11 operations=7 estimated_cycles=239696 estimated_exchange_cycles=105312 exchange_row_bytes=20152 peak_standard_bytes=90040 peak_interleaved_bytes=60416 peak_total_bytes=129976 maximum_standard_allocation_bytes=49152 active_tile_counts={192, 720, 1472} padding_group_counts={} conversion_sources=[] 2026-09-09T12:28:59.557482Z DEBUG retained operator-plan details finalist=5 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Normal, distribution: ParallelReduction { row_partitions: 10, column_partitions: 72, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1440, replicas: 72, axes: [AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 144, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }, 17278, 5104), (Some(OperationId(3)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(4)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(5)), View, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 720, replicas: 1, axes: [AxisTiling { axis: FromEnd(1), partitions: 72, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 10, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(72) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 0, 0), (Some(OperationId(6)), Attention { query_key: Some(ProductGrid { rows: 8, columns: 11, inner: 1 }), probability_value: Some(ProductGrid { rows: 8, columns: 1, inner: 8 }), materialized: true, key_block_rows: 768, padded_query_dimension: 80, padded_value_dimension: 80 }, [Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 166674, 92600)] conversions=[] 2026-09-09T12:28:59.559627Z INFO retained operator-plan finalist finalist=6 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.559639Z DEBUG retained operator-plan details finalist=6 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:59.578486Z INFO retained operator-plan finalist finalist=8 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 512, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.578502Z DEBUG retained operator-plan details finalist=8 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540)] 2026-09-09T12:28:59.580968Z INFO retained operator-plan finalist finalist=7 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.580982Z DEBUG retained operator-plan details finalist=7 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)] 2026-09-09T12:28:59.599845Z INFO retained operator-plan finalist finalist=9 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 256, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.599858Z DEBUG retained operator-plan details finalist=9 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540)] 2026-09-09T12:28:59.602322Z INFO retained operator-plan finalist finalist=8 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 512, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.602338Z DEBUG retained operator-plan details finalist=8 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 512, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 512, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 155940, 24540)] 2026-09-09T12:28:59.621197Z INFO retained operator-plan finalist finalist=10 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={128, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.621230Z DEBUG retained operator-plan details finalist=10 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.623673Z INFO retained operator-plan finalist finalist=9 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 256, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.623688Z DEBUG retained operator-plan details finalist=9 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 256, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 256, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 311880, 24540)] 2026-09-09T12:28:59.642576Z INFO retained operator-plan finalist finalist=11 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={64, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.642600Z DEBUG retained operator-plan details finalist=11 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.645004Z INFO retained operator-plan finalist finalist=10 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={128, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.645022Z DEBUG retained operator-plan details finalist=10 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 128, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 128, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.663938Z INFO retained operator-plan finalist finalist=12 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={32, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.663957Z DEBUG retained operator-plan details finalist=12 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.666356Z INFO retained operator-plan finalist finalist=11 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={64, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.666370Z DEBUG retained operator-plan details finalist=11 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 64, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 64, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.685316Z INFO retained operator-plan finalist finalist=13 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={16, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.685331Z DEBUG retained operator-plan details finalist=13 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.687703Z INFO retained operator-plan finalist finalist=12 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={32, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.687724Z DEBUG retained operator-plan details finalist=12 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 32, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 32, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.706667Z INFO retained operator-plan finalist finalist=14 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.706684Z DEBUG retained operator-plan details finalist=14 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:59.709291Z INFO retained operator-plan finalist finalist=13 values=14 operations=10 estimated_cycles=53093267 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=53504 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={16, 192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.709317Z DEBUG retained operator-plan details finalist=13 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 16, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 415840, 24540)] 2026-09-09T12:28:59.728067Z INFO retained operator-plan finalist finalist=15 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.728081Z DEBUG retained operator-plan details finalist=15 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)] 2026-09-09T12:28:59.730667Z INFO retained operator-plan finalist finalist=14 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.730698Z DEBUG retained operator-plan details finalist=14 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1472, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 54240, 24540)] 2026-09-09T12:28:59.752045Z INFO retained operator-plan finalist finalist=15 values=16 operations=12 estimated_cycles=53095175 estimated_exchange_cycles=213912 exchange_row_bytes=45504 peak_standard_bytes=570384 peak_interleaved_bytes=46592 peak_total_bytes=570384 maximum_standard_allocation_bytes=209952 active_tile_counts={192, 736, 1024, 1472} padding_group_counts={} conversion_sources=[Some(OperationId(1)), Some(OperationId(2)), Some(OperationId(6)), Some(OperationId(6)), Some(OperationId(6))] 2026-09-09T12:28:59.752058Z DEBUG retained operator-plan details finalist=15 plans=[(Some(OperationId(0)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 18804, 4944), (Some(OperationId(1)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(2)), BlockedGemm { inner_block: 576, output_column_block: 16, orientation: Swapped, distribution: ParallelReduction { row_partitions: 16, column_partitions: 46, inner_partitions: 2, result_row_partitions: 1, result_column_partitions: 1, reduction_staging: Complete } }, [Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 1472, replicas: 46, axes: [AxisTiling { axis: FromEnd(2), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }, 16896, 4944), (Some(OperationId(3)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 3139, 2040), (Some(OperationId(4)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 23939, 7000), (Some(OperationId(5)), View, [Layout { order: Amp(TransposedLeft), tiling: TensorTiling { tile_count: 736, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 16, padding_groups: 1, block_size: 2, padding_multiple: 2, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(46) }] }, memory_class: Ipu21Interleaved }], Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, 8568, 7000), (Some(OperationId(6)), Pointwise { kernel: FlashAttention { options: AttentionOptions { causal: false, scale: InverseSqrtQueryWidth }, accumulate: F32 } }, [Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }], Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 51228629, 0)] conversions=[(Some(OperationId(1)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(2)), Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: BlockMajor(TransposedMatrix { row_block: 576, column_block: 16 }), tiling: TensorTiling { tile_count: 1472, replicas: 16, axes: [AxisTiling { axis: FromEnd(2), partitions: 46, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 2, padding_groups: 1, block_size: 576, padding_multiple: 576, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Interleaved }, 1440, 0), (Some(OperationId(6)), Layout { order: Amp(Left), tiling: TensorTiling { tile_count: 1472, replicas: 1, axes: [AxisTiling { axis: FromEnd(2), partitions: 92, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 79296, 26556), (Some(OperationId(6)), Layout { order: Amp(TransposedRight), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540), (Some(OperationId(6)), Layout { order: BlockMajor(Matrix { row_block: 64, column_block: 16 }), tiling: TensorTiling { tile_count: 192, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 16, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: Some(1) }, AxisTiling { axis: FromEnd(2), partitions: 12, padding_groups: 1, block_size: 64, padding_multiple: 64, shard_padding_multiple: 1, padding: Zero, tile_stride: Some(16) }, AxisTiling { axis: FromEnd(1), partitions: 1, padding_groups: 1, block_size: 16, padding_multiple: 16, shard_padding_multiple: 1, padding: Zero, tile_stride: None }] }, memory_class: Ipu21Standard }, Layout { order: RowMajor, tiling: TensorTiling { tile_count: 1024, replicas: 1, axes: [AxisTiling { axis: FromEnd(3), partitions: 1024, padding_groups: 1, block_size: 1, padding_multiple: 1, shard_padding_multiple: 1, padding: Reject, tile_stride: None }] }, memory_class: Ipu21Standard }, 77970, 24540)]