| ; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py UTC_ARGS: --version 6 |
| ; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=fiji < %s | FileCheck -check-prefixes=GFX8 %s |
| ; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx900 < %s | FileCheck -check-prefixes=GFX9,GFX900 %s |
| ; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx942 < %s | FileCheck -check-prefixes=GFX9,GFX942 %s |
| ; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx1100 < %s | FileCheck -check-prefixes=GFX11 %s |
| ; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx1200 < %s | FileCheck -check-prefixes=GFX12 %s |
| |
| define void @v_constained_fma_f64_fpexcept_strict_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s18 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s20 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s19 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s21 |
| ; GFX8-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5] |
| ; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s18 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s20 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s19 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s21 |
| ; GFX900-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5] |
| ; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[2:3] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[16:17] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], v[4:5] |
| ; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], s[2:3], v[2:3] |
| ; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], s[2:3], v[2:3] |
| ; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_f64_fpexcept_strict_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5] |
| ; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5] |
| ; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5] |
| ; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5] |
| ; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v2f64_fpexcept_strict_uni(<2 x double> inreg %x, <2 x double> inreg %y, <2 x double> inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s20 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s24 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s21 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s25 |
| ; GFX8-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5] |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s22 |
| ; GFX8-NEXT: v_mov_b32_e32 v6, s26 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s23 |
| ; GFX8-NEXT: v_mov_b32_e32 v7, s27 |
| ; GFX8-NEXT: v_fma_f64 v[4:5], s[18:19], v[4:5], v[6:7] |
| ; GFX8-NEXT: v_readfirstlane_b32 s4, v2 |
| ; GFX8-NEXT: v_readfirstlane_b32 s5, v3 |
| ; GFX8-NEXT: v_readfirstlane_b32 s6, v4 |
| ; GFX8-NEXT: v_readfirstlane_b32 s7, v5 |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s4 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s5 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s6 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s7 |
| ; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[2:5] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s20 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s24 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s21 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s25 |
| ; GFX900-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5] |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s22 |
| ; GFX900-NEXT: v_mov_b32_e32 v6, s26 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s23 |
| ; GFX900-NEXT: v_mov_b32_e32 v7, s27 |
| ; GFX900-NEXT: v_fma_f64 v[4:5], s[18:19], v[4:5], v[6:7] |
| ; GFX900-NEXT: v_readfirstlane_b32 s4, v2 |
| ; GFX900-NEXT: v_readfirstlane_b32 s5, v3 |
| ; GFX900-NEXT: v_readfirstlane_b32 s6, v4 |
| ; GFX900-NEXT: v_readfirstlane_b32 s7, v5 |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s4 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s5 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s6 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s7 |
| ; GFX900-NEXT: global_store_dwordx4 v[0:1], v[2:5], off |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[16:17] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[20:21] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], v[4:5] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[22:23] |
| ; GFX942-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX942-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[18:19] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], s[2:3], v[2:3], v[4:5] |
| ; GFX942-NEXT: s_nop 0 |
| ; GFX942-NEXT: v_readfirstlane_b32 s2, v2 |
| ; GFX942-NEXT: v_readfirstlane_b32 s3, v3 |
| ; GFX942-NEXT: s_nop 1 |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3] |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1] |
| ; GFX942-NEXT: global_store_dwordx4 v[0:1], v[2:5], off |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23 |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX11-NEXT: v_fma_f64 v[4:5], s[2:3], s[18:19], v[4:5] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], s[16:17], v[2:3] |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX11-NEXT: v_readfirstlane_b32 s3, v5 |
| ; GFX11-NEXT: v_readfirstlane_b32 s2, v4 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4) |
| ; GFX11-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX11-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2 |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1 |
| ; GFX11-NEXT: global_store_b128 v[0:1], v[2:5], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX12-NEXT: v_fma_f64 v[4:5], s[2:3], s[18:19], v[4:5] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], s[16:17], v[2:3] |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX12-NEXT: v_readfirstlane_b32 s3, v5 |
| ; GFX12-NEXT: v_readfirstlane_b32 s2, v4 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4) |
| ; GFX12-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX12-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX12-NEXT: s_wait_alu depctr_va_sdst(0) |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX12-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1 |
| ; GFX12-NEXT: global_store_b128 v[0:1], v[2:5], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| |
| ; FIXME: Optimize readfirstlane |
| %val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %x, <2 x double> %y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <2 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v2f64_fpexcept_strict_div(<2 x double> %x, <2 x double> %y, <2 x double> %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9] |
| ; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11] |
| ; GFX8-NEXT: flat_store_dwordx4 v[12:13], v[0:3] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_v2f64_fpexcept_strict_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9] |
| ; GFX9-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11] |
| ; GFX9-NEXT: global_store_dwordx4 v[12:13], v[0:3], off |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11] |
| ; GFX11-NEXT: global_store_b128 v[12:13], v[0:3], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11] |
| ; GFX12-NEXT: global_store_b128 v[12:13], v[0:3], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %x, <2 x double> %y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <2 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v3f64_fpexcept_strict_uni(<3 x double> inreg %x, <3 x double> inreg %y, <3 x double> inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v6, s22 |
| ; GFX8-NEXT: v_mov_b32_e32 v8, s28 |
| ; GFX8-NEXT: v_mov_b32_e32 v7, s23 |
| ; GFX8-NEXT: v_mov_b32_e32 v9, s29 |
| ; GFX8-NEXT: v_fma_f64 v[6:7], s[16:17], v[6:7], v[8:9] |
| ; GFX8-NEXT: v_mov_b32_e32 v8, s24 |
| ; GFX8-NEXT: v_mov_b32_e32 v9, s25 |
| ; GFX8-NEXT: v_fma_f64 v[8:9], s[18:19], v[8:9], v[0:1] |
| ; GFX8-NEXT: v_mov_b32_e32 v0, s26 |
| ; GFX8-NEXT: v_mov_b32_e32 v1, s27 |
| ; GFX8-NEXT: v_fma_f64 v[0:1], s[20:21], v[0:1], v[2:3] |
| ; GFX8-NEXT: v_add_u32_e32 v2, vcc, 16, v4 |
| ; GFX8-NEXT: v_addc_u32_e32 v3, vcc, 0, v5, vcc |
| ; GFX8-NEXT: flat_store_dwordx4 v[4:5], v[6:9] |
| ; GFX8-NEXT: flat_store_dwordx2 v[2:3], v[0:1] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v6, s22 |
| ; GFX900-NEXT: v_mov_b32_e32 v8, s28 |
| ; GFX900-NEXT: v_mov_b32_e32 v7, s23 |
| ; GFX900-NEXT: v_mov_b32_e32 v9, s29 |
| ; GFX900-NEXT: v_fma_f64 v[6:7], s[16:17], v[6:7], v[8:9] |
| ; GFX900-NEXT: v_mov_b32_e32 v8, s24 |
| ; GFX900-NEXT: v_mov_b32_e32 v9, s25 |
| ; GFX900-NEXT: v_fma_f64 v[8:9], s[18:19], v[8:9], v[0:1] |
| ; GFX900-NEXT: v_mov_b32_e32 v0, s26 |
| ; GFX900-NEXT: v_mov_b32_e32 v1, s27 |
| ; GFX900-NEXT: v_fma_f64 v[0:1], s[20:21], v[0:1], v[2:3] |
| ; GFX900-NEXT: global_store_dwordx4 v[4:5], v[6:9], off |
| ; GFX900-NEXT: global_store_dwordx2 v[4:5], v[0:1], off offset:16 |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[18:19] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[24:25] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], v[4:5] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[26:27] |
| ; GFX942-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX942-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[20:21] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], s[2:3], v[2:3], v[4:5] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[28:29] |
| ; GFX942-NEXT: v_readfirstlane_b32 s2, v2 |
| ; GFX942-NEXT: v_readfirstlane_b32 s3, v3 |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[22:23] |
| ; GFX942-NEXT: v_fma_f64 v[6:7], s[16:17], v[2:3], v[4:5] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3] |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1] |
| ; GFX942-NEXT: global_store_dwordx4 v[0:1], v[2:5], off |
| ; GFX942-NEXT: global_store_dwordx2 v[0:1], v[6:7], off offset:16 |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v4, s26 :: v_dual_mov_b32 v5, s27 |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s24 :: v_dual_mov_b32 v3, s25 |
| ; GFX11-NEXT: v_dual_mov_b32 v6, s28 :: v_dual_mov_b32 v7, s29 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX11-NEXT: v_fma_f64 v[4:5], s[2:3], s[20:21], v[4:5] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], s[18:19], v[2:3] |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX11-NEXT: v_fma_f64 v[6:7], s[16:17], s[22:23], v[6:7] |
| ; GFX11-NEXT: v_readfirstlane_b32 s3, v5 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_4) | instskip(NEXT) | instid1(VALU_DEP_4) |
| ; GFX11-NEXT: v_readfirstlane_b32 s2, v4 |
| ; GFX11-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX11-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2 |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1 |
| ; GFX11-NEXT: s_clause 0x1 |
| ; GFX11-NEXT: global_store_b128 v[0:1], v[2:5], off |
| ; GFX11-NEXT: global_store_b64 v[0:1], v[6:7], off offset:16 |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v4, s26 :: v_dual_mov_b32 v5, s27 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s24 :: v_dual_mov_b32 v3, s25 |
| ; GFX12-NEXT: v_dual_mov_b32 v6, s28 :: v_dual_mov_b32 v7, s29 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX12-NEXT: v_fma_f64 v[4:5], s[2:3], s[20:21], v[4:5] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], s[18:19], v[2:3] |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX12-NEXT: v_fma_f64 v[6:7], s[16:17], s[22:23], v[6:7] |
| ; GFX12-NEXT: v_readfirstlane_b32 s3, v5 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_4) | instskip(NEXT) | instid1(VALU_DEP_4) |
| ; GFX12-NEXT: v_readfirstlane_b32 s2, v4 |
| ; GFX12-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX12-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX12-NEXT: s_wait_alu depctr_va_sdst(0) |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX12-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1 |
| ; GFX12-NEXT: s_clause 0x1 |
| ; GFX12-NEXT: global_store_b128 v[0:1], v[2:5], off |
| ; GFX12-NEXT: global_store_b64 v[0:1], v[6:7], off offset:16 |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %val = call <3 x double> @llvm.experimental.constrained.fma.v3f64(<3 x double> %x, <3 x double> %y, <3 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <3 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v3f64_fpexcept_strict_div(<3 x double> %x, <3 x double> %y, <3 x double> %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v3f64_fpexcept_strict_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13] |
| ; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15] |
| ; GFX8-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17] |
| ; GFX8-NEXT: flat_store_dwordx4 v[18:19], v[0:3] |
| ; GFX8-NEXT: s_nop 0 |
| ; GFX8-NEXT: v_add_u32_e32 v0, vcc, 16, v18 |
| ; GFX8-NEXT: v_addc_u32_e32 v1, vcc, 0, v19, vcc |
| ; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[4:5] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_v3f64_fpexcept_strict_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13] |
| ; GFX9-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15] |
| ; GFX9-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17] |
| ; GFX9-NEXT: global_store_dwordx4 v[18:19], v[0:3], off |
| ; GFX9-NEXT: global_store_dwordx2 v[18:19], v[4:5], off offset:16 |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v3f64_fpexcept_strict_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15] |
| ; GFX11-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17] |
| ; GFX11-NEXT: s_clause 0x1 |
| ; GFX11-NEXT: global_store_b128 v[18:19], v[0:3], off |
| ; GFX11-NEXT: global_store_b64 v[18:19], v[4:5], off offset:16 |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v3f64_fpexcept_strict_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15] |
| ; GFX12-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17] |
| ; GFX12-NEXT: s_clause 0x1 |
| ; GFX12-NEXT: global_store_b128 v[18:19], v[0:3], off |
| ; GFX12-NEXT: global_store_b64 v[18:19], v[4:5], off offset:16 |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %val = call <3 x double> @llvm.experimental.constrained.fma.v3f64(<3 x double> %x, <3 x double> %y, <3 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <3 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v4f64_fpexcept_strict_uni(<4 x double> inreg %x, <4 x double> inreg %y, <4 x double> inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v12, s24 |
| ; GFX8-NEXT: v_mov_b32_e32 v13, s25 |
| ; GFX8-NEXT: v_fma_f64 v[2:3], s[16:17], v[12:13], v[2:3] |
| ; GFX8-NEXT: v_mov_b32_e32 v12, s26 |
| ; GFX8-NEXT: v_mov_b32_e32 v13, s27 |
| ; GFX8-NEXT: v_fma_f64 v[4:5], s[18:19], v[12:13], v[4:5] |
| ; GFX8-NEXT: v_mov_b32_e32 v12, s28 |
| ; GFX8-NEXT: v_mov_b32_e32 v13, s29 |
| ; GFX8-NEXT: v_fma_f64 v[6:7], s[20:21], v[12:13], v[6:7] |
| ; GFX8-NEXT: v_fma_f64 v[8:9], s[22:23], v[0:1], v[8:9] |
| ; GFX8-NEXT: v_add_u32_e32 v0, vcc, 16, v10 |
| ; GFX8-NEXT: v_addc_u32_e32 v1, vcc, 0, v11, vcc |
| ; GFX8-NEXT: flat_store_dwordx4 v[10:11], v[2:5] |
| ; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[6:9] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v12, s24 |
| ; GFX900-NEXT: v_mov_b32_e32 v13, s25 |
| ; GFX900-NEXT: v_fma_f64 v[2:3], s[16:17], v[12:13], v[2:3] |
| ; GFX900-NEXT: v_mov_b32_e32 v12, s26 |
| ; GFX900-NEXT: v_mov_b32_e32 v13, s27 |
| ; GFX900-NEXT: v_fma_f64 v[4:5], s[18:19], v[12:13], v[4:5] |
| ; GFX900-NEXT: v_mov_b32_e32 v12, s28 |
| ; GFX900-NEXT: v_mov_b32_e32 v13, s29 |
| ; GFX900-NEXT: v_fma_f64 v[6:7], s[20:21], v[12:13], v[6:7] |
| ; GFX900-NEXT: v_fma_f64 v[8:9], s[22:23], v[0:1], v[8:9] |
| ; GFX900-NEXT: global_store_dwordx4 v[10:11], v[2:5], off |
| ; GFX900-NEXT: global_store_dwordx4 v[10:11], v[6:9], off offset:16 |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[8:9], s[20:21] |
| ; GFX942-NEXT: v_mov_b64_e32 v[10:11], s[28:29] |
| ; GFX942-NEXT: v_fma_f64 v[8:9], s[0:1], v[8:9], v[10:11] |
| ; GFX942-NEXT: v_mov_b64_e32 v[10:11], s[22:23] |
| ; GFX942-NEXT: v_fma_f64 v[10:11], s[2:3], v[10:11], v[0:1] |
| ; GFX942-NEXT: v_mov_b64_e32 v[0:1], s[24:25] |
| ; GFX942-NEXT: v_fma_f64 v[0:1], s[16:17], v[0:1], v[2:3] |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[26:27] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], s[18:19], v[2:3], v[4:5] |
| ; GFX942-NEXT: global_store_dwordx4 v[6:7], v[8:11], off |
| ; GFX942-NEXT: global_store_dwordx4 v[6:7], v[0:3], off offset:16 |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v8, s28 :: v_dual_mov_b32 v9, s29 |
| ; GFX11-NEXT: v_fma_f64 v[10:11], s[2:3], s[22:23], v[0:1] |
| ; GFX11-NEXT: v_fma_f64 v[0:1], s[16:17], s[24:25], v[2:3] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], s[18:19], s[26:27], v[4:5] |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_4) |
| ; GFX11-NEXT: v_fma_f64 v[8:9], s[0:1], s[20:21], v[8:9] |
| ; GFX11-NEXT: s_clause 0x1 |
| ; GFX11-NEXT: global_store_b128 v[6:7], v[8:11], off |
| ; GFX11-NEXT: global_store_b128 v[6:7], v[0:3], off offset:16 |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v8, s28 :: v_dual_mov_b32 v9, s29 |
| ; GFX12-NEXT: v_fma_f64 v[10:11], s[2:3], s[22:23], v[0:1] |
| ; GFX12-NEXT: v_fma_f64 v[0:1], s[16:17], s[24:25], v[2:3] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], s[18:19], s[26:27], v[4:5] |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_4) |
| ; GFX12-NEXT: v_fma_f64 v[8:9], s[0:1], s[20:21], v[8:9] |
| ; GFX12-NEXT: s_clause 0x1 |
| ; GFX12-NEXT: global_store_b128 v[6:7], v[8:11], off |
| ; GFX12-NEXT: global_store_b128 v[6:7], v[0:3], off offset:16 |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %val = call <4 x double> @llvm.experimental.constrained.fma.v4f64(<4 x double> %x, <4 x double> %y, <4 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <4 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v4f64_fpexcept_strict_div(<4 x double> %x, <4 x double> %y, <4 x double> %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v4f64_fpexcept_strict_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17] |
| ; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19] |
| ; GFX8-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21] |
| ; GFX8-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23] |
| ; GFX8-NEXT: flat_store_dwordx4 v[24:25], v[0:3] |
| ; GFX8-NEXT: s_nop 0 |
| ; GFX8-NEXT: v_add_u32_e32 v0, vcc, 16, v24 |
| ; GFX8-NEXT: v_addc_u32_e32 v1, vcc, 0, v25, vcc |
| ; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[4:7] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_v4f64_fpexcept_strict_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17] |
| ; GFX9-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19] |
| ; GFX9-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21] |
| ; GFX9-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23] |
| ; GFX9-NEXT: global_store_dwordx4 v[24:25], v[0:3], off |
| ; GFX9-NEXT: global_store_dwordx4 v[24:25], v[4:7], off offset:16 |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v4f64_fpexcept_strict_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19] |
| ; GFX11-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21] |
| ; GFX11-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23] |
| ; GFX11-NEXT: s_clause 0x1 |
| ; GFX11-NEXT: global_store_b128 v[24:25], v[0:3], off |
| ; GFX11-NEXT: global_store_b128 v[24:25], v[4:7], off offset:16 |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v4f64_fpexcept_strict_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19] |
| ; GFX12-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21] |
| ; GFX12-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23] |
| ; GFX12-NEXT: s_clause 0x1 |
| ; GFX12-NEXT: global_store_b128 v[24:25], v[0:3], off |
| ; GFX12-NEXT: global_store_b128 v[24:25], v[4:7], off offset:16 |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %val = call <4 x double> @llvm.experimental.constrained.fma.v4f64(<4 x double> %x, <4 x double> %y, <4 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <4 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_f64_fpexcept_strict_fneg_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s16 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s18 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s17 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s19 |
| ; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[4:5], -s[20:21] |
| ; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s16 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s18 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s17 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s19 |
| ; GFX900-NEXT: v_fma_f64 v[2:3], v[2:3], v[4:5], -s[20:21] |
| ; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], v[2:3], v[4:5], -s[16:17] |
| ; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s2 :: v_dual_mov_b32 v3, s3 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], -s[16:17] |
| ; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s2 :: v_dual_mov_b32 v3, s3 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], -s[16:17] |
| ; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.z = fneg double %z |
| %val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %neg.z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_f64_fpexcept_strict_fneg_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5] |
| ; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5] |
| ; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5] |
| ; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5] |
| ; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.z = fneg double %z |
| %val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %neg.z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s18 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s20 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s19 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s21 |
| ; GFX8-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[4:5] |
| ; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s18 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s20 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s19 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s21 |
| ; GFX900-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[4:5] |
| ; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[2:3] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[16:17] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], -s[0:1], -v[2:3], v[4:5] |
| ; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX11-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[2:3], v[2:3] |
| ; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX12-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[2:3], v[2:3] |
| ; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.x = fneg double %x |
| %neg.y = fneg double %y |
| %val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_f64_fpexcept_strict_fneg_fneg_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5] |
| ; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5] |
| ; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5] |
| ; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5] |
| ; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.x = fneg double %x |
| %neg.y = fneg double %y |
| %val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s18 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s20 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s19 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s21 |
| ; GFX8-NEXT: v_fma_f64 v[2:3], |s[16:17]|, |v[2:3]|, v[4:5] |
| ; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s18 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s20 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s19 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s21 |
| ; GFX900-NEXT: v_fma_f64 v[2:3], |s[16:17]|, |v[2:3]|, v[4:5] |
| ; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[2:3] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[16:17] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], |s[0:1]|, |v[2:3]|, v[4:5] |
| ; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX11-NEXT: v_fma_f64 v[2:3], |s[0:1]|, |s[2:3]|, v[2:3] |
| ; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1) |
| ; GFX12-NEXT: v_fma_f64 v[2:3], |s[0:1]|, |s[2:3]|, v[2:3] |
| ; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.x = call double @llvm.fabs.f64(double %x) #0 |
| %neg.y = call double @llvm.fabs.f64(double %y) #0 |
| %val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_f64_fpexcept_strict_fabs_fabs_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5] |
| ; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5] |
| ; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5] |
| ; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5] |
| ; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.x = call double @llvm.fabs.f64(double %x) #0 |
| %neg.y = call double @llvm.fabs.f64(double %y) #0 |
| %val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store double %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni(<2 x double> inreg %x, <2 x double> inreg %y, <2 x double> inreg %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s20 |
| ; GFX8-NEXT: v_mov_b32_e32 v6, s24 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s21 |
| ; GFX8-NEXT: v_mov_b32_e32 v7, s25 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s22 |
| ; GFX8-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[6:7] |
| ; GFX8-NEXT: v_mov_b32_e32 v6, s26 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s23 |
| ; GFX8-NEXT: v_mov_b32_e32 v7, s27 |
| ; GFX8-NEXT: v_fma_f64 v[4:5], -s[18:19], -v[4:5], v[6:7] |
| ; GFX8-NEXT: v_readfirstlane_b32 s4, v2 |
| ; GFX8-NEXT: v_readfirstlane_b32 s5, v3 |
| ; GFX8-NEXT: v_readfirstlane_b32 s6, v4 |
| ; GFX8-NEXT: v_readfirstlane_b32 s7, v5 |
| ; GFX8-NEXT: v_mov_b32_e32 v2, s4 |
| ; GFX8-NEXT: v_mov_b32_e32 v3, s5 |
| ; GFX8-NEXT: v_mov_b32_e32 v4, s6 |
| ; GFX8-NEXT: v_mov_b32_e32 v5, s7 |
| ; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[2:5] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX900-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX900: ; %bb.0: |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s20 |
| ; GFX900-NEXT: v_mov_b32_e32 v6, s24 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s21 |
| ; GFX900-NEXT: v_mov_b32_e32 v7, s25 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s22 |
| ; GFX900-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[6:7] |
| ; GFX900-NEXT: v_mov_b32_e32 v6, s26 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s23 |
| ; GFX900-NEXT: v_mov_b32_e32 v7, s27 |
| ; GFX900-NEXT: v_fma_f64 v[4:5], -s[18:19], -v[4:5], v[6:7] |
| ; GFX900-NEXT: v_readfirstlane_b32 s4, v2 |
| ; GFX900-NEXT: v_readfirstlane_b32 s5, v3 |
| ; GFX900-NEXT: v_readfirstlane_b32 s6, v4 |
| ; GFX900-NEXT: v_readfirstlane_b32 s7, v5 |
| ; GFX900-NEXT: v_mov_b32_e32 v2, s4 |
| ; GFX900-NEXT: v_mov_b32_e32 v3, s5 |
| ; GFX900-NEXT: v_mov_b32_e32 v4, s6 |
| ; GFX900-NEXT: v_mov_b32_e32 v5, s7 |
| ; GFX900-NEXT: global_store_dwordx4 v[0:1], v[2:5], off |
| ; GFX900-NEXT: s_waitcnt vmcnt(0) |
| ; GFX900-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX942-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX942: ; %bb.0: |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[16:17] |
| ; GFX942-NEXT: v_mov_b64_e32 v[6:7], s[20:21] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], -s[0:1], -v[2:3], v[6:7] |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[18:19] |
| ; GFX942-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX942-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[22:23] |
| ; GFX942-NEXT: v_fma_f64 v[2:3], -s[2:3], -v[4:5], v[2:3] |
| ; GFX942-NEXT: s_nop 0 |
| ; GFX942-NEXT: v_readfirstlane_b32 s2, v2 |
| ; GFX942-NEXT: v_readfirstlane_b32 s3, v3 |
| ; GFX942-NEXT: s_nop 1 |
| ; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3] |
| ; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1] |
| ; GFX942-NEXT: global_store_dwordx4 v[0:1], v[2:5], off |
| ; GFX942-NEXT: s_waitcnt vmcnt(0) |
| ; GFX942-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23 |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX11-NEXT: v_fma_f64 v[4:5], -s[2:3], -s[18:19], v[4:5] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[16:17], v[2:3] |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX11-NEXT: v_readfirstlane_b32 s3, v5 |
| ; GFX11-NEXT: v_readfirstlane_b32 s2, v4 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4) |
| ; GFX11-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX11-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2 |
| ; GFX11-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1 |
| ; GFX11-NEXT: global_store_b128 v[0:1], v[2:5], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX12-NEXT: v_fma_f64 v[4:5], -s[2:3], -s[18:19], v[4:5] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[16:17], v[2:3] |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3) |
| ; GFX12-NEXT: v_readfirstlane_b32 s3, v5 |
| ; GFX12-NEXT: v_readfirstlane_b32 s2, v4 |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4) |
| ; GFX12-NEXT: v_readfirstlane_b32 s0, v2 |
| ; GFX12-NEXT: v_readfirstlane_b32 s1, v3 |
| ; GFX12-NEXT: s_wait_alu depctr_va_sdst(0) |
| ; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2) |
| ; GFX12-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2 |
| ; GFX12-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1 |
| ; GFX12-NEXT: global_store_b128 v[0:1], v[2:5], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.x = fneg <2 x double> %x |
| %neg.y = fneg <2 x double> %y |
| %val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %neg.x, <2 x double> %neg.y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <2 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define void @v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div(<2 x double> %x, <2 x double> %y, <2 x double> %z, ptr addrspace(1) %out) #0 { |
| ; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX8: ; %bb.0: |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX8-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9] |
| ; GFX8-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11] |
| ; GFX8-NEXT: flat_store_dwordx4 v[12:13], v[0:3] |
| ; GFX8-NEXT: s_waitcnt vmcnt(0) |
| ; GFX8-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX9-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9] |
| ; GFX9-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11] |
| ; GFX9-NEXT: global_store_dwordx4 v[12:13], v[0:3], off |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX11: ; %bb.0: |
| ; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX11-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9] |
| ; GFX11-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11] |
| ; GFX11-NEXT: global_store_b128 v[12:13], v[0:3], off |
| ; GFX11-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9] |
| ; GFX12-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11] |
| ; GFX12-NEXT: global_store_b128 v[12:13], v[0:3], off |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %neg.x = fneg <2 x double> %x |
| %neg.y = fneg <2 x double> %y |
| %val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %neg.x, <2 x double> %neg.y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict") |
| store <2 x double> %val, ptr addrspace(1) %out |
| ret void |
| } |
| |
| declare double @llvm.fabs.f64(double) |
| declare double @llvm.experimental.constrained.fma.f64(double, double, double, metadata, metadata) |
| declare <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double>, <2 x double>, <2 x double>, metadata, metadata) |
| declare <3 x double> @llvm.experimental.constrained.fma.v3f64(<3 x double>, <3 x double>, <3 x double>, metadata, metadata) |
| declare <4 x double> @llvm.experimental.constrained.fma.v4f64(<4 x double>, <4 x double>, <4 x double>, metadata, metadata) |
| |
| attributes #0 = { strictfp } |