This patch fixes issues that broke internal benchmarks as well as individual fusions reported. --- a/lib/Dialect/TritonGPU/Transforms/AccelerateMatmul.cpp +++ b/lib/Dialect/TritonGPU/Transforms/AccelerateMatmul.cpp @@ -351,6 +351,16 @@ getWarpsPerTile(DotOpInterface dotOp, const ArrayRef shape, } static bool bwdFilter(Operation *op) { + // Dot operand layout assignment to Predicates are not currently supported + // during lowering from TritonGPU to LLVM in Triton for MMA cases. This + // condition limits visibility of the original bit-width so that predicate + // are not considered, hence, kwidth can never be = 32. + if (isa(op)) { + Type srcType = getElementTypeOrSelf(op->getOperand(0)); + if (srcType.isInteger(1)) + return false; + } + return (op->hasTrait() && isMemoryEffectFree(op)) || isView(op) || isa