| ; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py UTC_ARGS: --version 6 |
| ; RUN: llc -global-isel=1 -mtriple=amdgpu9.00 -amdgpu-enable-delay-alu=0 -o - %s | FileCheck -check-prefix=GFX9 %s |
| ; RUN: llc -global-isel=1 -mtriple=amdgpu12.00 -amdgpu-enable-delay-alu=0 -o - %s | FileCheck -check-prefix=GFX12 %s |
| ; RUN: llc -global-isel=1 -mtriple=amdgpu12.50 -amdgpu-enable-delay-alu=0 -o - %s | FileCheck -check-prefix=GFX1250 %s |
| |
| define amdgpu_ps bfloat @fcanonicalize_bf16_v(bfloat %src) { |
| ; GFX9-LABEL: fcanonicalize_bf16_v: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: v_lshlrev_b32_e32 v0, 16, v0 |
| ; GFX9-NEXT: v_max_f32_e32 v0, v0, v0 |
| ; GFX9-NEXT: v_bfe_u32 v2, v0, 16, 1 |
| ; GFX9-NEXT: v_mov_b32_e32 v3, 0x7fff |
| ; GFX9-NEXT: v_or_b32_e32 v1, 0x400000, v0 |
| ; GFX9-NEXT: v_add3_u32 v2, v2, v0, v3 |
| ; GFX9-NEXT: v_cmp_u_f32_e32 vcc, 0, v0 |
| ; GFX9-NEXT: v_cndmask_b32_e32 v0, v2, v1, vcc |
| ; GFX9-NEXT: v_lshrrev_b32_e32 v0, 16, v0 |
| ; GFX9-NEXT: ; return to shader part epilog |
| ; |
| ; GFX12-LABEL: fcanonicalize_bf16_v: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: v_lshlrev_b32_e32 v0, 16, v0 |
| ; GFX12-NEXT: v_max_num_f32_e32 v0, v0, v0 |
| ; GFX12-NEXT: v_bfe_u32 v1, v0, 16, 1 |
| ; GFX12-NEXT: v_or_b32_e32 v2, 0x400000, v0 |
| ; GFX12-NEXT: v_cmp_u_f32_e32 vcc_lo, 0, v0 |
| ; GFX12-NEXT: v_add3_u32 v1, v1, v0, 0x7fff |
| ; GFX12-NEXT: v_cndmask_b32_e32 v0, v1, v2, vcc_lo |
| ; GFX12-NEXT: v_mov_b16_e32 v0.l, v0.h |
| ; GFX12-NEXT: ; return to shader part epilog |
| ; |
| ; GFX1250-LABEL: fcanonicalize_bf16_v: |
| ; GFX1250: ; %bb.0: |
| ; GFX1250-NEXT: s_setreg_imm32_b32 hwreg(HW_REG_WAVE_MODE, 25, 1), 1 ; msbs: dst=0 src0=0 src1=0 src2=0 |
| ; GFX1250-NEXT: s_mov_b64 s[64:65], 0 |
| ; GFX1250-NEXT: v_nop |
| ; GFX1250-NEXT: global_prefetch_b8 v0, s[64:65] scope:SCOPE_SE |
| ; GFX1250-NEXT: v_lshlrev_b32_e32 v0, 16, v0 |
| ; GFX1250-NEXT: v_max_num_f32_e32 v0, v0, v0 |
| ; GFX1250-NEXT: v_bfe_u32 v1, v0, 16, 1 |
| ; GFX1250-NEXT: v_or_b32_e32 v2, 0x400000, v0 |
| ; GFX1250-NEXT: v_cmp_u_f32_e32 vcc_lo, 0, v0 |
| ; GFX1250-NEXT: v_add3_u32 v1, v1, v0, 0x7fff |
| ; GFX1250-NEXT: v_cndmask_b32_e32 v0, v1, v2, vcc_lo |
| ; GFX1250-NEXT: v_mov_b16_e32 v0.l, v0.h |
| ; GFX1250-NEXT: ; return to shader part epilog |
| %result = call bfloat @llvm.canonicalize.bf16(bfloat %src) |
| ret bfloat %result |
| } |
| |
| define amdgpu_ps bfloat @fcanonicalize_bf16_s(bfloat inreg %src) { |
| ; GFX9-LABEL: fcanonicalize_bf16_s: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_lshl_b32 s0, s0, 16 |
| ; GFX9-NEXT: v_max_f32_e64 v0, s0, s0 |
| ; GFX9-NEXT: v_readfirstlane_b32 s0, v0 |
| ; GFX9-NEXT: s_bfe_u32 s2, s0, 0x10010 |
| ; GFX9-NEXT: s_or_b32 s1, s0, 0x400000 |
| ; GFX9-NEXT: s_add_i32 s0, s2, s0 |
| ; GFX9-NEXT: s_addk_i32 s0, 0x7fff |
| ; GFX9-NEXT: v_cmp_u_f32_e32 vcc, 0, v0 |
| ; GFX9-NEXT: s_cmp_lg_u64 vcc, 0 |
| ; GFX9-NEXT: s_cselect_b32 s0, s1, s0 |
| ; GFX9-NEXT: s_lshr_b32 s0, s0, 16 |
| ; GFX9-NEXT: v_mov_b32_e32 v0, s0 |
| ; GFX9-NEXT: ; return to shader part epilog |
| ; |
| ; GFX12-LABEL: fcanonicalize_bf16_s: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_lshl_b32 s0, s0, 16 |
| ; GFX12-NEXT: v_max_num_f32_e64 v0, s0, s0 |
| ; GFX12-NEXT: v_readfirstlane_b32 s0, v0 |
| ; GFX12-NEXT: s_bfe_u32 s1, s0, 0x10010 |
| ; GFX12-NEXT: s_or_b32 s2, s0, 0x400000 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_add_co_i32 s1, s1, s0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_addk_co_i32 s1, 0x7fff |
| ; GFX12-NEXT: s_cmp_u_f32 s0, 0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_cselect_b32 s0, s2, s1 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_lshr_b32 s0, s0, 16 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: v_mov_b32_e32 v0, s0 |
| ; GFX12-NEXT: ; return to shader part epilog |
| ; |
| ; GFX1250-LABEL: fcanonicalize_bf16_s: |
| ; GFX1250: ; %bb.0: |
| ; GFX1250-NEXT: s_setreg_imm32_b32 hwreg(HW_REG_WAVE_MODE, 25, 1), 1 ; msbs: dst=0 src0=0 src1=0 src2=0 |
| ; GFX1250-NEXT: s_mov_b64 s[64:65], 0 |
| ; GFX1250-NEXT: v_nop |
| ; GFX1250-NEXT: global_prefetch_b8 v0, s[64:65] scope:SCOPE_SE |
| ; GFX1250-NEXT: s_lshl_b32 s0, s0, 16 |
| ; GFX1250-NEXT: v_max_num_f32_e64 v0, s0, s0 |
| ; GFX1250-NEXT: v_readfirstlane_b32 s0, v0 |
| ; GFX1250-NEXT: s_bfe_u32 s1, s0, 0x10010 |
| ; GFX1250-NEXT: s_or_b32 s2, s0, 0x400000 |
| ; GFX1250-NEXT: s_add_co_i32 s1, s1, s0 |
| ; GFX1250-NEXT: s_addk_co_i32 s1, 0x7fff |
| ; GFX1250-NEXT: s_cmp_u_f32 s0, 0 |
| ; GFX1250-NEXT: s_cselect_b32 s0, s2, s1 |
| ; GFX1250-NEXT: s_lshr_b32 s0, s0, 16 |
| ; GFX1250-NEXT: v_mov_b32_e32 v0, s0 |
| ; GFX1250-NEXT: ; return to shader part epilog |
| %result = call bfloat @llvm.canonicalize.bf16(bfloat %src) |
| ret bfloat %result |
| } |
| |
| define amdgpu_ps <2 x bfloat> @fcanonicalize_v2bf16_v(<2 x bfloat> %src) { |
| ; GFX9-LABEL: fcanonicalize_v2bf16_v: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: v_lshrrev_b32_e32 v1, 16, v0 |
| ; GFX9-NEXT: v_lshlrev_b32_e32 v0, 16, v0 |
| ; GFX9-NEXT: v_max_f32_e32 v0, v0, v0 |
| ; GFX9-NEXT: v_bfe_u32 v3, v0, 16, 1 |
| ; GFX9-NEXT: v_mov_b32_e32 v4, 0x7fff |
| ; GFX9-NEXT: v_lshlrev_b32_e32 v1, 16, v1 |
| ; GFX9-NEXT: v_or_b32_e32 v2, 0x400000, v0 |
| ; GFX9-NEXT: v_add3_u32 v3, v3, v0, v4 |
| ; GFX9-NEXT: v_cmp_u_f32_e32 vcc, 0, v0 |
| ; GFX9-NEXT: v_max_f32_e32 v1, v1, v1 |
| ; GFX9-NEXT: v_cndmask_b32_e32 v0, v3, v2, vcc |
| ; GFX9-NEXT: v_bfe_u32 v3, v1, 16, 1 |
| ; GFX9-NEXT: v_or_b32_e32 v2, 0x400000, v1 |
| ; GFX9-NEXT: v_add3_u32 v3, v3, v1, v4 |
| ; GFX9-NEXT: v_cmp_u_f32_e32 vcc, 0, v1 |
| ; GFX9-NEXT: v_cndmask_b32_e32 v1, v3, v2, vcc |
| ; GFX9-NEXT: s_mov_b32 s0, 0x7060302 |
| ; GFX9-NEXT: v_perm_b32 v0, v1, v0, s0 |
| ; GFX9-NEXT: ; return to shader part epilog |
| ; |
| ; GFX12-LABEL: fcanonicalize_v2bf16_v: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: v_mov_b16_e32 v1.l, v0.h |
| ; GFX12-NEXT: v_lshlrev_b32_e32 v1, 16, v1 |
| ; GFX12-NEXT: v_dual_max_num_f32 v1, v1, v1 :: v_dual_lshlrev_b32 v0, 16, v0 |
| ; GFX12-NEXT: v_max_num_f32_e32 v0, v0, v0 |
| ; GFX12-NEXT: v_bfe_u32 v3, v1, 16, 1 |
| ; GFX12-NEXT: v_bfe_u32 v2, v0, 16, 1 |
| ; GFX12-NEXT: v_or_b32_e32 v4, 0x400000, v0 |
| ; GFX12-NEXT: v_cmp_u_f32_e32 vcc_lo, 0, v0 |
| ; GFX12-NEXT: v_or_b32_e32 v5, 0x400000, v1 |
| ; GFX12-NEXT: v_add3_u32 v3, v3, v1, 0x7fff |
| ; GFX12-NEXT: v_add3_u32 v2, v2, v0, 0x7fff |
| ; GFX12-NEXT: v_cndmask_b32_e32 v2, v2, v4, vcc_lo |
| ; GFX12-NEXT: v_cmp_u_f32_e32 vcc_lo, 0, v1 |
| ; GFX12-NEXT: s_wait_alu depctr_va_vcc(0) |
| ; GFX12-NEXT: v_cndmask_b32_e32 v0, v3, v5, vcc_lo |
| ; GFX12-NEXT: v_mov_b16_e32 v0.l, v2.h |
| ; GFX12-NEXT: ; return to shader part epilog |
| ; |
| ; GFX1250-LABEL: fcanonicalize_v2bf16_v: |
| ; GFX1250: ; %bb.0: |
| ; GFX1250-NEXT: s_setreg_imm32_b32 hwreg(HW_REG_WAVE_MODE, 25, 1), 1 ; msbs: dst=0 src0=0 src1=0 src2=0 |
| ; GFX1250-NEXT: s_mov_b64 s[64:65], 0 |
| ; GFX1250-NEXT: v_nop |
| ; GFX1250-NEXT: global_prefetch_b8 v0, s[64:65] scope:SCOPE_SE |
| ; GFX1250-NEXT: v_mov_b16_e32 v1.l, v0.h |
| ; GFX1250-NEXT: v_dual_lshlrev_b32 v0, 16, v0 :: v_dual_lshlrev_b32 v1, 16, v1 |
| ; GFX1250-NEXT: v_dual_max_num_f32 v0, v0, v0 :: v_dual_max_num_f32 v1, v1, v1 |
| ; GFX1250-NEXT: v_bfe_u32 v2, v0, 16, 1 |
| ; GFX1250-NEXT: v_or_b32_e32 v4, 0x400000, v0 |
| ; GFX1250-NEXT: v_cmp_u_f32_e32 vcc_lo, 0, v0 |
| ; GFX1250-NEXT: v_bfe_u32 v3, v1, 16, 1 |
| ; GFX1250-NEXT: v_add3_u32 v2, v2, v0, 0x7fff |
| ; GFX1250-NEXT: v_or_b32_e32 v5, 0x400000, v1 |
| ; GFX1250-NEXT: v_add3_u32 v3, v3, v1, 0x7fff |
| ; GFX1250-NEXT: v_cndmask_b32_e32 v2, v2, v4, vcc_lo |
| ; GFX1250-NEXT: v_cmp_u_f32_e32 vcc_lo, 0, v1 |
| ; GFX1250-NEXT: v_cndmask_b32_e32 v0, v3, v5, vcc_lo |
| ; GFX1250-NEXT: v_mov_b16_e32 v0.l, v2.h |
| ; GFX1250-NEXT: ; return to shader part epilog |
| %result = call <2 x bfloat> @llvm.canonicalize.v2bf16(<2 x bfloat> %src) |
| ret <2 x bfloat> %result |
| } |
| |
| define amdgpu_ps <2 x bfloat> @fcanonicalize_v2bf16_s(<2 x bfloat> inreg %src) { |
| ; GFX9-LABEL: fcanonicalize_v2bf16_s: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_lshr_b32 s1, s0, 16 |
| ; GFX9-NEXT: s_lshl_b32 s0, s0, 16 |
| ; GFX9-NEXT: v_max_f32_e64 v0, s0, s0 |
| ; GFX9-NEXT: v_readfirstlane_b32 s0, v0 |
| ; GFX9-NEXT: s_bfe_u32 s3, s0, 0x10010 |
| ; GFX9-NEXT: s_or_b32 s2, s0, 0x400000 |
| ; GFX9-NEXT: s_add_i32 s0, s3, s0 |
| ; GFX9-NEXT: s_addk_i32 s0, 0x7fff |
| ; GFX9-NEXT: v_cmp_u_f32_e32 vcc, 0, v0 |
| ; GFX9-NEXT: s_cmp_lg_u64 vcc, 0 |
| ; GFX9-NEXT: s_cselect_b32 s0, s2, s0 |
| ; GFX9-NEXT: s_lshl_b32 s1, s1, 16 |
| ; GFX9-NEXT: v_max_f32_e64 v0, s1, s1 |
| ; GFX9-NEXT: v_readfirstlane_b32 s1, v0 |
| ; GFX9-NEXT: s_bfe_u32 s3, s1, 0x10010 |
| ; GFX9-NEXT: s_or_b32 s2, s1, 0x400000 |
| ; GFX9-NEXT: s_add_i32 s1, s3, s1 |
| ; GFX9-NEXT: s_addk_i32 s1, 0x7fff |
| ; GFX9-NEXT: v_cmp_u_f32_e32 vcc, 0, v0 |
| ; GFX9-NEXT: s_cmp_lg_u64 vcc, 0 |
| ; GFX9-NEXT: s_cselect_b32 s1, s2, s1 |
| ; GFX9-NEXT: s_pack_hh_b32_b16 s0, s0, s1 |
| ; GFX9-NEXT: v_mov_b32_e32 v0, s0 |
| ; GFX9-NEXT: ; return to shader part epilog |
| ; |
| ; GFX12-LABEL: fcanonicalize_v2bf16_s: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_lshl_b32 s1, s0, 16 |
| ; GFX12-NEXT: s_lshr_b32 s0, s0, 16 |
| ; GFX12-NEXT: v_max_num_f32_e64 v0, s1, s1 |
| ; GFX12-NEXT: v_readfirstlane_b32 s1, v0 |
| ; GFX12-NEXT: s_bfe_u32 s2, s1, 0x10010 |
| ; GFX12-NEXT: s_or_b32 s3, s1, 0x400000 |
| ; GFX12-NEXT: s_add_co_i32 s2, s2, s1 |
| ; GFX12-NEXT: s_addk_co_i32 s2, 0x7fff |
| ; GFX12-NEXT: s_cmp_u_f32 s1, 0 |
| ; GFX12-NEXT: s_cselect_b32 s1, s3, s2 |
| ; GFX12-NEXT: s_lshl_b32 s0, s0, 16 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_lshr_b32 s1, s1, 16 |
| ; GFX12-NEXT: v_max_num_f32_e64 v0, s0, s0 |
| ; GFX12-NEXT: v_readfirstlane_b32 s0, v0 |
| ; GFX12-NEXT: s_bfe_u32 s2, s0, 0x10010 |
| ; GFX12-NEXT: s_or_b32 s3, s0, 0x400000 |
| ; GFX12-NEXT: s_add_co_i32 s2, s2, s0 |
| ; GFX12-NEXT: s_addk_co_i32 s2, 0x7fff |
| ; GFX12-NEXT: s_cmp_u_f32 s0, 0 |
| ; GFX12-NEXT: s_cselect_b32 s0, s3, s2 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_lshr_b32 s0, s0, 16 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_pack_ll_b32_b16 s0, s1, s0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: v_mov_b32_e32 v0, s0 |
| ; GFX12-NEXT: ; return to shader part epilog |
| ; |
| ; GFX1250-LABEL: fcanonicalize_v2bf16_s: |
| ; GFX1250: ; %bb.0: |
| ; GFX1250-NEXT: s_setreg_imm32_b32 hwreg(HW_REG_WAVE_MODE, 25, 1), 1 ; msbs: dst=0 src0=0 src1=0 src2=0 |
| ; GFX1250-NEXT: s_mov_b64 s[64:65], 0 |
| ; GFX1250-NEXT: v_nop |
| ; GFX1250-NEXT: global_prefetch_b8 v0, s[64:65] scope:SCOPE_SE |
| ; GFX1250-NEXT: s_lshl_b32 s1, s0, 16 |
| ; GFX1250-NEXT: s_lshr_b32 s0, s0, 16 |
| ; GFX1250-NEXT: v_max_num_f32_e64 v0, s1, s1 |
| ; GFX1250-NEXT: v_readfirstlane_b32 s1, v0 |
| ; GFX1250-NEXT: s_bfe_u32 s2, s1, 0x10010 |
| ; GFX1250-NEXT: s_or_b32 s3, s1, 0x400000 |
| ; GFX1250-NEXT: s_add_co_i32 s2, s2, s1 |
| ; GFX1250-NEXT: s_addk_co_i32 s2, 0x7fff |
| ; GFX1250-NEXT: s_cmp_u_f32 s1, 0 |
| ; GFX1250-NEXT: s_cselect_b32 s1, s3, s2 |
| ; GFX1250-NEXT: s_lshl_b32 s0, s0, 16 |
| ; GFX1250-NEXT: s_lshr_b32 s1, s1, 16 |
| ; GFX1250-NEXT: v_max_num_f32_e64 v0, s0, s0 |
| ; GFX1250-NEXT: v_readfirstlane_b32 s0, v0 |
| ; GFX1250-NEXT: s_bfe_u32 s2, s0, 0x10010 |
| ; GFX1250-NEXT: s_or_b32 s3, s0, 0x400000 |
| ; GFX1250-NEXT: s_add_co_i32 s2, s2, s0 |
| ; GFX1250-NEXT: s_addk_co_i32 s2, 0x7fff |
| ; GFX1250-NEXT: s_cmp_u_f32 s0, 0 |
| ; GFX1250-NEXT: s_cselect_b32 s0, s3, s2 |
| ; GFX1250-NEXT: s_lshr_b32 s0, s0, 16 |
| ; GFX1250-NEXT: s_pack_ll_b32_b16 s0, s1, s0 |
| ; GFX1250-NEXT: v_mov_b32_e32 v0, s0 |
| ; GFX1250-NEXT: ; return to shader part epilog |
| %result = call <2 x bfloat> @llvm.canonicalize.v2bf16(<2 x bfloat> %src) |
| ret <2 x bfloat> %result |
| } |
| |
| declare bfloat @llvm.canonicalize.bf16(bfloat) |
| declare <2 x bfloat> @llvm.canonicalize.v2bf16(<2 x bfloat>) |