	.text
	.allow_optimizations
	.file	"3"
	.section	.text.__runCodelet_GeluF8,"ax",@progbits
	.globl	__runCodelet_GeluF8             # -- Begin function __runCodelet_GeluF8
	.p2align	2
	.type	__runCodelet_GeluF8,@function
__runCodelet_GeluF8:                    # @__runCodelet_GeluF8
	.worker
.Lfunc_begin0:
# %bb.0:                                # %entry
	setzi $m6, 16
	cmpult $m6, $m6, __worker_stack_max_growth_plus_one
	brz $m6, _stackoverflow
	add $m11, $m12, -16
	{
		get $m3, 1
		setzi $a0, 2
	}
	ld32 $m0, $m13, $m15, 4
	sub $m0, 0, $m0
	and $m0, $m0, 255
	st32 $m0, $m11, $m15, 1
	ld32 $a1, $m11, $m15, 1
	#APP
	put	9, $a0
	put	10, $a1
	#NO_APP
	ld32 $m0, $m13, $m15, 2
	brz $m0, .LBB0_7
# %bb.1:                                # %for.body.lr.ph.i
	mov	$m1, $m15
	mov	$m2, $m15
	ld32 $m5, $m13, $m15, 3
	ld32 $m4, $m13, $m15, 5
	cmpeq $m6, $m4, 0
	shl $m3, $m3, 3
	and $m3, $m3, 56
	add $m4, $m5, 31
	andc $m4, $m4, 31
	movnz	$m4, $m6, $m5
	cmpult $m5, $m3, $m4
	bri .LBB0_2
.LBB0_5:                                # %for.cond.cleanup6.loopexit.i
                                        #   in Loop: Header=BB0_2 Depth=1
	ld32 $m0, $m13, $m15, 2
.LBB0_6:                                # %for.cond.cleanup6.i
                                        #   in Loop: Header=BB0_2 Depth=1
	add $m2, $m2, 1
	cmpult $m6, $m2, $m0
	add $m1, $m1, $m4
	brz $m6, .LBB0_7
.LBB0_2:                                # %for.body.i
                                        # =>This Loop Header: Depth=1
                                        #     Child Loop BB0_3 Depth 2
	mov	$m6, $m3
	brnz $m5, .LBB0_3
	bri .LBB0_6
.LBB0_11:                               # %cond.false.i.i
                                        #   in Loop: Header=BB0_3 Depth=2
	add $m7, $m1, $m6
.LBB0_12:                               # %_ZL8storeFp8PhjjjjbDv4_DhS0_.exit.i
                                        #   in Loop: Header=BB0_3 Depth=2
	add $m6, $m6, 48
	add $m0, $m0, $m7
	#APP
	mov	$ap0, $ap2
	mov	$ap1, $ap3
	f16v8tof8 $ap0, $aq0
	st64 $ap0, $m0, $m15, 0

	#NO_APP
	cmpult $m0, $m6, $m4
	brz $m0, .LBB0_5
.LBB0_3:                                # %for.body7.i
                                        #   Parent Loop BB0_2 Depth=1
                                        # =>  This Inner Loop Header: Depth=2
	ld32 $m0, $m13, $m15, 3
	cmpult $m7, $m6, $m0
	brz $m7, .LBB0_4
# %bb.8:                                # %if.then.i
                                        #   in Loop: Header=BB0_3 Depth=2
	mul $m0, $m2, $m0
	add $m0, $m6, $m0
	ld32 $m7, $m13, $m15, 0
	shl $m0, $m0, 1
	add $m7, $m7, $m0
	#APP
	ld64 $ap0, $m7, $m15, 0
	setzi $a2, 18432
	or $a2, $a2, 1207959552
	mov	$a3, $a2
	f16v4min $ap0, $ap0, $ap1
	setzi $a2, 51200
	or $a2, $a2, 3355443200
	mov	$a3, $a2
	f16v4max $ap0, $ap0, $ap1
	f16v4mul $ap1, $ap0, $ap0
	f16v4mul $ap1, $ap1, $ap0
	setzi $a4, 600505
	or $a4, $a4, 699400192
	f16v4mul $ap1, $a4:BL, $ap1
	f16v4add $ap1, $ap0, $ap1
	setzi $a4, 146018
	or $a4, $a4, 979369984
	f16v4mul $ap1, $a4:BL, $ap1
	{
		ld64 $ap0, $m7, $m15, 0
		f16v2tanh $a2, $a2
	}

	f16v2tanh $a3, $a3
	setzi $a4, 15360
	or $a4, $a4, 1006632960
	f16v4add $ap1, $a4:BL, $ap1
	setzi $a4, 14336
	or $a4, $a4, 939524096
	f16v4mul $ap1, $a4:BL, $ap1
	f16v4mul $ap3, $ap0, $ap1

	#NO_APP
	st64 $ap3, $m11, $m15, 1                # 8-byte Folded Spill
	ld32 $m0, $m13, $m15, 3
	mul $m0, $m2, $m0
	add $m0, $m6, $m0
	shl $m0, $m0, 1
	ld32 $m7, $m13, $m15, 0
	add $m0, $m0, $m7
	add $m7, $m0, 8
	#APP
	ld64 $ap0, $m7, $m15, 0
	setzi $a2, 18432
	or $a2, $a2, 1207959552
	mov	$a3, $a2
	f16v4min $ap0, $ap0, $ap1
	setzi $a2, 51200
	or $a2, $a2, 3355443200
	mov	$a3, $a2
	f16v4max $ap0, $ap0, $ap1
	f16v4mul $ap1, $ap0, $ap0
	f16v4mul $ap1, $ap1, $ap0
	setzi $a4, 600505
	or $a4, $a4, 699400192
	f16v4mul $ap1, $a4:BL, $ap1
	f16v4add $ap1, $ap0, $ap1
	setzi $a4, 146018
	or $a4, $a4, 979369984
	f16v4mul $ap1, $a4:BL, $ap1
	{
		ld64 $ap0, $m7, $m15, 0
		f16v2tanh $a2, $a2
	}

	f16v2tanh $a3, $a3
	setzi $a4, 15360
	or $a4, $a4, 1006632960
	f16v4add $ap1, $a4:BL, $ap1
	setzi $a4, 14336
	or $a4, $a4, 939524096
	f16v4mul $ap1, $a4:BL, $ap1
	f16v4mul $ap3, $ap0, $ap1

	#NO_APP
	ld64 $ap2, $m11, $m15, 1                # 8-byte Folded Reload
	bri .LBB0_9
.LBB0_4:                                #   in Loop: Header=BB0_3 Depth=2
	zero	$ap2
	zero	$ap3
.LBB0_9:                                # %if.end.i
                                        #   in Loop: Header=BB0_3 Depth=2
	ld32 $m7, $m13, $m15, 5
	ld32 $m0, $m13, $m15, 1
	brz $m7, .LBB0_11
# %bb.10:                               # %cond.true.i.i
                                        #   in Loop: Header=BB0_3 Depth=2
	ld32 $m7, $m13, $m15, 2
	shr $m8, $m6, 5
	mul $m7, $m7, $m8
	add $m7, $m7, $m2
	shl $m7, $m7, 5
	and $m8, $m6, 24
	or $m7, $m7, $m8
	bri .LBB0_12
.LBB0_7:                                # %_ZN6GeluF87computeEj.exit
	exitz $m15
.Lfunc_end0:
	.size	__runCodelet_GeluF8, .Lfunc_end0-__runCodelet_GeluF8
	.section	.stack_sizes,"o",@progbits,.text.__runCodelet_GeluF8
	.long	.Lfunc_begin0
	.byte	16
	.section	.text.__runCodelet_GeluF8,"ax",@progbits
                                        # -- End function
	.ident	"clang version 16.0.0 (git@github.com:Software-GCAI/llvm-project.git 6343a843cd5af31429c62a83b6ba249a74d36969)"
	.section	".note.GNU-stack","",@progbits
	.addrsig
