blob: 0c949fb1ae7635507cbd74bcc296114af08ca9e8 [file]
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py UTC_ARGS: --version 6
; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=fiji < %s | FileCheck -check-prefixes=GFX8 %s
; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx900 < %s | FileCheck -check-prefixes=GFX9,GFX900 %s
; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx942 < %s | FileCheck -check-prefixes=GFX9,GFX942 %s
; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx1100 < %s | FileCheck -check-prefixes=GFX11 %s
; RUN: llc -global-isel -new-reg-bank-select -mtriple=amdgcn-mesa-mesa3d -mcpu=gfx1200 < %s | FileCheck -check-prefixes=GFX12 %s
define void @v_constained_fma_f64_fpexcept_strict_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v2, s18
; GFX8-NEXT: v_mov_b32_e32 v4, s20
; GFX8-NEXT: v_mov_b32_e32 v3, s19
; GFX8-NEXT: v_mov_b32_e32 v5, s21
; GFX8-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5]
; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v2, s18
; GFX900-NEXT: v_mov_b32_e32 v4, s20
; GFX900-NEXT: v_mov_b32_e32 v3, s19
; GFX900-NEXT: v_mov_b32_e32 v5, s21
; GFX900-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5]
; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[2:3]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[16:17]
; GFX942-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], v[4:5]
; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], s[2:3], v[2:3]
; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], s[2:3], v[2:3]
; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_f64_fpexcept_strict_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5]
; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5]
; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5]
; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], v[4:5]
; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v2f64_fpexcept_strict_uni(<2 x double> inreg %x, <2 x double> inreg %y, <2 x double> inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v2, s20
; GFX8-NEXT: v_mov_b32_e32 v4, s24
; GFX8-NEXT: v_mov_b32_e32 v3, s21
; GFX8-NEXT: v_mov_b32_e32 v5, s25
; GFX8-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5]
; GFX8-NEXT: v_mov_b32_e32 v4, s22
; GFX8-NEXT: v_mov_b32_e32 v6, s26
; GFX8-NEXT: v_mov_b32_e32 v5, s23
; GFX8-NEXT: v_mov_b32_e32 v7, s27
; GFX8-NEXT: v_fma_f64 v[4:5], s[18:19], v[4:5], v[6:7]
; GFX8-NEXT: v_readfirstlane_b32 s4, v2
; GFX8-NEXT: v_readfirstlane_b32 s5, v3
; GFX8-NEXT: v_readfirstlane_b32 s6, v4
; GFX8-NEXT: v_readfirstlane_b32 s7, v5
; GFX8-NEXT: v_mov_b32_e32 v2, s4
; GFX8-NEXT: v_mov_b32_e32 v3, s5
; GFX8-NEXT: v_mov_b32_e32 v4, s6
; GFX8-NEXT: v_mov_b32_e32 v5, s7
; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[2:5]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v2, s20
; GFX900-NEXT: v_mov_b32_e32 v4, s24
; GFX900-NEXT: v_mov_b32_e32 v3, s21
; GFX900-NEXT: v_mov_b32_e32 v5, s25
; GFX900-NEXT: v_fma_f64 v[2:3], s[16:17], v[2:3], v[4:5]
; GFX900-NEXT: v_mov_b32_e32 v4, s22
; GFX900-NEXT: v_mov_b32_e32 v6, s26
; GFX900-NEXT: v_mov_b32_e32 v5, s23
; GFX900-NEXT: v_mov_b32_e32 v7, s27
; GFX900-NEXT: v_fma_f64 v[4:5], s[18:19], v[4:5], v[6:7]
; GFX900-NEXT: v_readfirstlane_b32 s4, v2
; GFX900-NEXT: v_readfirstlane_b32 s5, v3
; GFX900-NEXT: v_readfirstlane_b32 s6, v4
; GFX900-NEXT: v_readfirstlane_b32 s7, v5
; GFX900-NEXT: v_mov_b32_e32 v2, s4
; GFX900-NEXT: v_mov_b32_e32 v3, s5
; GFX900-NEXT: v_mov_b32_e32 v4, s6
; GFX900-NEXT: v_mov_b32_e32 v5, s7
; GFX900-NEXT: global_store_dwordx4 v[0:1], v[2:5], off
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[16:17]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[20:21]
; GFX942-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], v[4:5]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[22:23]
; GFX942-NEXT: v_readfirstlane_b32 s0, v2
; GFX942-NEXT: v_readfirstlane_b32 s1, v3
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[18:19]
; GFX942-NEXT: v_fma_f64 v[2:3], s[2:3], v[2:3], v[4:5]
; GFX942-NEXT: s_nop 0
; GFX942-NEXT: v_readfirstlane_b32 s2, v2
; GFX942-NEXT: v_readfirstlane_b32 s3, v3
; GFX942-NEXT: s_nop 1
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3]
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1]
; GFX942-NEXT: global_store_dwordx4 v[0:1], v[2:5], off
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23
; GFX11-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX11-NEXT: v_fma_f64 v[4:5], s[2:3], s[18:19], v[4:5]
; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], s[16:17], v[2:3]
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX11-NEXT: v_readfirstlane_b32 s3, v5
; GFX11-NEXT: v_readfirstlane_b32 s2, v4
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4)
; GFX11-NEXT: v_readfirstlane_b32 s0, v2
; GFX11-NEXT: v_readfirstlane_b32 s1, v3
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
; GFX11-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1
; GFX11-NEXT: global_store_b128 v[0:1], v[2:5], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23
; GFX12-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX12-NEXT: v_fma_f64 v[4:5], s[2:3], s[18:19], v[4:5]
; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], s[16:17], v[2:3]
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX12-NEXT: v_readfirstlane_b32 s3, v5
; GFX12-NEXT: v_readfirstlane_b32 s2, v4
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4)
; GFX12-NEXT: v_readfirstlane_b32 s0, v2
; GFX12-NEXT: v_readfirstlane_b32 s1, v3
; GFX12-NEXT: s_wait_alu depctr_va_sdst(0)
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX12-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
; GFX12-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1
; GFX12-NEXT: global_store_b128 v[0:1], v[2:5], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
; FIXME: Optimize readfirstlane
%val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %x, <2 x double> %y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <2 x double> %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v2f64_fpexcept_strict_div(<2 x double> %x, <2 x double> %y, <2 x double> %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9]
; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11]
; GFX8-NEXT: flat_store_dwordx4 v[12:13], v[0:3]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_v2f64_fpexcept_strict_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9]
; GFX9-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11]
; GFX9-NEXT: global_store_dwordx4 v[12:13], v[0:3], off
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9]
; GFX11-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11]
; GFX11-NEXT: global_store_b128 v[12:13], v[0:3], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[4:5], v[8:9]
; GFX12-NEXT: v_fma_f64 v[2:3], v[2:3], v[6:7], v[10:11]
; GFX12-NEXT: global_store_b128 v[12:13], v[0:3], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %x, <2 x double> %y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <2 x double> %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v3f64_fpexcept_strict_uni(<3 x double> inreg %x, <3 x double> inreg %y, <3 x double> inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v6, s22
; GFX8-NEXT: v_mov_b32_e32 v8, s28
; GFX8-NEXT: v_mov_b32_e32 v7, s23
; GFX8-NEXT: v_mov_b32_e32 v9, s29
; GFX8-NEXT: v_fma_f64 v[6:7], s[16:17], v[6:7], v[8:9]
; GFX8-NEXT: v_mov_b32_e32 v8, s24
; GFX8-NEXT: v_mov_b32_e32 v9, s25
; GFX8-NEXT: v_fma_f64 v[8:9], s[18:19], v[8:9], v[0:1]
; GFX8-NEXT: v_mov_b32_e32 v0, s26
; GFX8-NEXT: v_mov_b32_e32 v1, s27
; GFX8-NEXT: v_fma_f64 v[0:1], s[20:21], v[0:1], v[2:3]
; GFX8-NEXT: v_add_u32_e32 v2, vcc, 16, v4
; GFX8-NEXT: v_addc_u32_e32 v3, vcc, 0, v5, vcc
; GFX8-NEXT: flat_store_dwordx4 v[4:5], v[6:9]
; GFX8-NEXT: flat_store_dwordx2 v[2:3], v[0:1]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v6, s22
; GFX900-NEXT: v_mov_b32_e32 v8, s28
; GFX900-NEXT: v_mov_b32_e32 v7, s23
; GFX900-NEXT: v_mov_b32_e32 v9, s29
; GFX900-NEXT: v_fma_f64 v[6:7], s[16:17], v[6:7], v[8:9]
; GFX900-NEXT: v_mov_b32_e32 v8, s24
; GFX900-NEXT: v_mov_b32_e32 v9, s25
; GFX900-NEXT: v_fma_f64 v[8:9], s[18:19], v[8:9], v[0:1]
; GFX900-NEXT: v_mov_b32_e32 v0, s26
; GFX900-NEXT: v_mov_b32_e32 v1, s27
; GFX900-NEXT: v_fma_f64 v[0:1], s[20:21], v[0:1], v[2:3]
; GFX900-NEXT: global_store_dwordx4 v[4:5], v[6:9], off
; GFX900-NEXT: global_store_dwordx2 v[4:5], v[0:1], off offset:16
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[18:19]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[24:25]
; GFX942-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], v[4:5]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[26:27]
; GFX942-NEXT: v_readfirstlane_b32 s0, v2
; GFX942-NEXT: v_readfirstlane_b32 s1, v3
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[20:21]
; GFX942-NEXT: v_fma_f64 v[2:3], s[2:3], v[2:3], v[4:5]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[28:29]
; GFX942-NEXT: v_readfirstlane_b32 s2, v2
; GFX942-NEXT: v_readfirstlane_b32 s3, v3
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[22:23]
; GFX942-NEXT: v_fma_f64 v[6:7], s[16:17], v[2:3], v[4:5]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3]
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1]
; GFX942-NEXT: global_store_dwordx4 v[0:1], v[2:5], off
; GFX942-NEXT: global_store_dwordx2 v[0:1], v[6:7], off offset:16
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v4, s26 :: v_dual_mov_b32 v5, s27
; GFX11-NEXT: v_dual_mov_b32 v2, s24 :: v_dual_mov_b32 v3, s25
; GFX11-NEXT: v_dual_mov_b32 v6, s28 :: v_dual_mov_b32 v7, s29
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX11-NEXT: v_fma_f64 v[4:5], s[2:3], s[20:21], v[4:5]
; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], s[18:19], v[2:3]
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX11-NEXT: v_fma_f64 v[6:7], s[16:17], s[22:23], v[6:7]
; GFX11-NEXT: v_readfirstlane_b32 s3, v5
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_4) | instskip(NEXT) | instid1(VALU_DEP_4)
; GFX11-NEXT: v_readfirstlane_b32 s2, v4
; GFX11-NEXT: v_readfirstlane_b32 s0, v2
; GFX11-NEXT: v_readfirstlane_b32 s1, v3
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
; GFX11-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1
; GFX11-NEXT: s_clause 0x1
; GFX11-NEXT: global_store_b128 v[0:1], v[2:5], off
; GFX11-NEXT: global_store_b64 v[0:1], v[6:7], off offset:16
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v3f64_fpexcept_strict_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v4, s26 :: v_dual_mov_b32 v5, s27
; GFX12-NEXT: v_dual_mov_b32 v2, s24 :: v_dual_mov_b32 v3, s25
; GFX12-NEXT: v_dual_mov_b32 v6, s28 :: v_dual_mov_b32 v7, s29
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX12-NEXT: v_fma_f64 v[4:5], s[2:3], s[20:21], v[4:5]
; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], s[18:19], v[2:3]
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX12-NEXT: v_fma_f64 v[6:7], s[16:17], s[22:23], v[6:7]
; GFX12-NEXT: v_readfirstlane_b32 s3, v5
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_4) | instskip(NEXT) | instid1(VALU_DEP_4)
; GFX12-NEXT: v_readfirstlane_b32 s2, v4
; GFX12-NEXT: v_readfirstlane_b32 s0, v2
; GFX12-NEXT: v_readfirstlane_b32 s1, v3
; GFX12-NEXT: s_wait_alu depctr_va_sdst(0)
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX12-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
; GFX12-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1
; GFX12-NEXT: s_clause 0x1
; GFX12-NEXT: global_store_b128 v[0:1], v[2:5], off
; GFX12-NEXT: global_store_b64 v[0:1], v[6:7], off offset:16
; GFX12-NEXT: s_setpc_b64 s[30:31]
%val = call <3 x double> @llvm.experimental.constrained.fma.v3f64(<3 x double> %x, <3 x double> %y, <3 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <3 x double> %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v3f64_fpexcept_strict_div(<3 x double> %x, <3 x double> %y, <3 x double> %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v3f64_fpexcept_strict_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13]
; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15]
; GFX8-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17]
; GFX8-NEXT: flat_store_dwordx4 v[18:19], v[0:3]
; GFX8-NEXT: s_nop 0
; GFX8-NEXT: v_add_u32_e32 v0, vcc, 16, v18
; GFX8-NEXT: v_addc_u32_e32 v1, vcc, 0, v19, vcc
; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[4:5]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_v3f64_fpexcept_strict_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13]
; GFX9-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15]
; GFX9-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17]
; GFX9-NEXT: global_store_dwordx4 v[18:19], v[0:3], off
; GFX9-NEXT: global_store_dwordx2 v[18:19], v[4:5], off offset:16
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v3f64_fpexcept_strict_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13]
; GFX11-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15]
; GFX11-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17]
; GFX11-NEXT: s_clause 0x1
; GFX11-NEXT: global_store_b128 v[18:19], v[0:3], off
; GFX11-NEXT: global_store_b64 v[18:19], v[4:5], off offset:16
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v3f64_fpexcept_strict_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[6:7], v[12:13]
; GFX12-NEXT: v_fma_f64 v[2:3], v[2:3], v[8:9], v[14:15]
; GFX12-NEXT: v_fma_f64 v[4:5], v[4:5], v[10:11], v[16:17]
; GFX12-NEXT: s_clause 0x1
; GFX12-NEXT: global_store_b128 v[18:19], v[0:3], off
; GFX12-NEXT: global_store_b64 v[18:19], v[4:5], off offset:16
; GFX12-NEXT: s_setpc_b64 s[30:31]
%val = call <3 x double> @llvm.experimental.constrained.fma.v3f64(<3 x double> %x, <3 x double> %y, <3 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <3 x double> %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v4f64_fpexcept_strict_uni(<4 x double> inreg %x, <4 x double> inreg %y, <4 x double> inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v12, s24
; GFX8-NEXT: v_mov_b32_e32 v13, s25
; GFX8-NEXT: v_fma_f64 v[2:3], s[16:17], v[12:13], v[2:3]
; GFX8-NEXT: v_mov_b32_e32 v12, s26
; GFX8-NEXT: v_mov_b32_e32 v13, s27
; GFX8-NEXT: v_fma_f64 v[4:5], s[18:19], v[12:13], v[4:5]
; GFX8-NEXT: v_mov_b32_e32 v12, s28
; GFX8-NEXT: v_mov_b32_e32 v13, s29
; GFX8-NEXT: v_fma_f64 v[6:7], s[20:21], v[12:13], v[6:7]
; GFX8-NEXT: v_fma_f64 v[8:9], s[22:23], v[0:1], v[8:9]
; GFX8-NEXT: v_add_u32_e32 v0, vcc, 16, v10
; GFX8-NEXT: v_addc_u32_e32 v1, vcc, 0, v11, vcc
; GFX8-NEXT: flat_store_dwordx4 v[10:11], v[2:5]
; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[6:9]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v12, s24
; GFX900-NEXT: v_mov_b32_e32 v13, s25
; GFX900-NEXT: v_fma_f64 v[2:3], s[16:17], v[12:13], v[2:3]
; GFX900-NEXT: v_mov_b32_e32 v12, s26
; GFX900-NEXT: v_mov_b32_e32 v13, s27
; GFX900-NEXT: v_fma_f64 v[4:5], s[18:19], v[12:13], v[4:5]
; GFX900-NEXT: v_mov_b32_e32 v12, s28
; GFX900-NEXT: v_mov_b32_e32 v13, s29
; GFX900-NEXT: v_fma_f64 v[6:7], s[20:21], v[12:13], v[6:7]
; GFX900-NEXT: v_fma_f64 v[8:9], s[22:23], v[0:1], v[8:9]
; GFX900-NEXT: global_store_dwordx4 v[10:11], v[2:5], off
; GFX900-NEXT: global_store_dwordx4 v[10:11], v[6:9], off offset:16
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[8:9], s[20:21]
; GFX942-NEXT: v_mov_b64_e32 v[10:11], s[28:29]
; GFX942-NEXT: v_fma_f64 v[8:9], s[0:1], v[8:9], v[10:11]
; GFX942-NEXT: v_mov_b64_e32 v[10:11], s[22:23]
; GFX942-NEXT: v_fma_f64 v[10:11], s[2:3], v[10:11], v[0:1]
; GFX942-NEXT: v_mov_b64_e32 v[0:1], s[24:25]
; GFX942-NEXT: v_fma_f64 v[0:1], s[16:17], v[0:1], v[2:3]
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[26:27]
; GFX942-NEXT: v_fma_f64 v[2:3], s[18:19], v[2:3], v[4:5]
; GFX942-NEXT: global_store_dwordx4 v[6:7], v[8:11], off
; GFX942-NEXT: global_store_dwordx4 v[6:7], v[0:3], off offset:16
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v8, s28 :: v_dual_mov_b32 v9, s29
; GFX11-NEXT: v_fma_f64 v[10:11], s[2:3], s[22:23], v[0:1]
; GFX11-NEXT: v_fma_f64 v[0:1], s[16:17], s[24:25], v[2:3]
; GFX11-NEXT: v_fma_f64 v[2:3], s[18:19], s[26:27], v[4:5]
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_4)
; GFX11-NEXT: v_fma_f64 v[8:9], s[0:1], s[20:21], v[8:9]
; GFX11-NEXT: s_clause 0x1
; GFX11-NEXT: global_store_b128 v[6:7], v[8:11], off
; GFX11-NEXT: global_store_b128 v[6:7], v[0:3], off offset:16
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v4f64_fpexcept_strict_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v8, s28 :: v_dual_mov_b32 v9, s29
; GFX12-NEXT: v_fma_f64 v[10:11], s[2:3], s[22:23], v[0:1]
; GFX12-NEXT: v_fma_f64 v[0:1], s[16:17], s[24:25], v[2:3]
; GFX12-NEXT: v_fma_f64 v[2:3], s[18:19], s[26:27], v[4:5]
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_4)
; GFX12-NEXT: v_fma_f64 v[8:9], s[0:1], s[20:21], v[8:9]
; GFX12-NEXT: s_clause 0x1
; GFX12-NEXT: global_store_b128 v[6:7], v[8:11], off
; GFX12-NEXT: global_store_b128 v[6:7], v[0:3], off offset:16
; GFX12-NEXT: s_setpc_b64 s[30:31]
%val = call <4 x double> @llvm.experimental.constrained.fma.v4f64(<4 x double> %x, <4 x double> %y, <4 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <4 x double> %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v4f64_fpexcept_strict_div(<4 x double> %x, <4 x double> %y, <4 x double> %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v4f64_fpexcept_strict_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17]
; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19]
; GFX8-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21]
; GFX8-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23]
; GFX8-NEXT: flat_store_dwordx4 v[24:25], v[0:3]
; GFX8-NEXT: s_nop 0
; GFX8-NEXT: v_add_u32_e32 v0, vcc, 16, v24
; GFX8-NEXT: v_addc_u32_e32 v1, vcc, 0, v25, vcc
; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[4:7]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_v4f64_fpexcept_strict_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17]
; GFX9-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19]
; GFX9-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21]
; GFX9-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23]
; GFX9-NEXT: global_store_dwordx4 v[24:25], v[0:3], off
; GFX9-NEXT: global_store_dwordx4 v[24:25], v[4:7], off offset:16
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v4f64_fpexcept_strict_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17]
; GFX11-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19]
; GFX11-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21]
; GFX11-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23]
; GFX11-NEXT: s_clause 0x1
; GFX11-NEXT: global_store_b128 v[24:25], v[0:3], off
; GFX11-NEXT: global_store_b128 v[24:25], v[4:7], off offset:16
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v4f64_fpexcept_strict_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[8:9], v[16:17]
; GFX12-NEXT: v_fma_f64 v[2:3], v[2:3], v[10:11], v[18:19]
; GFX12-NEXT: v_fma_f64 v[4:5], v[4:5], v[12:13], v[20:21]
; GFX12-NEXT: v_fma_f64 v[6:7], v[6:7], v[14:15], v[22:23]
; GFX12-NEXT: s_clause 0x1
; GFX12-NEXT: global_store_b128 v[24:25], v[0:3], off
; GFX12-NEXT: global_store_b128 v[24:25], v[4:7], off offset:16
; GFX12-NEXT: s_setpc_b64 s[30:31]
%val = call <4 x double> @llvm.experimental.constrained.fma.v4f64(<4 x double> %x, <4 x double> %y, <4 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <4 x double> %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_f64_fpexcept_strict_fneg_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v2, s16
; GFX8-NEXT: v_mov_b32_e32 v4, s18
; GFX8-NEXT: v_mov_b32_e32 v3, s17
; GFX8-NEXT: v_mov_b32_e32 v5, s19
; GFX8-NEXT: v_fma_f64 v[2:3], v[2:3], v[4:5], -s[20:21]
; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v2, s16
; GFX900-NEXT: v_mov_b32_e32 v4, s18
; GFX900-NEXT: v_mov_b32_e32 v3, s17
; GFX900-NEXT: v_mov_b32_e32 v5, s19
; GFX900-NEXT: v_fma_f64 v[2:3], v[2:3], v[4:5], -s[20:21]
; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3]
; GFX942-NEXT: v_fma_f64 v[2:3], v[2:3], v[4:5], -s[16:17]
; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v2, s2 :: v_dual_mov_b32 v3, s3
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX11-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], -s[16:17]
; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v2, s2 :: v_dual_mov_b32 v3, s3
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX12-NEXT: v_fma_f64 v[2:3], s[0:1], v[2:3], -s[16:17]
; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.z = fneg double %z
%val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %neg.z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_f64_fpexcept_strict_fneg_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5]
; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5]
; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5]
; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], v[0:1], v[2:3], -v[4:5]
; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.z = fneg double %z
%val = call double @llvm.experimental.constrained.fma.f64(double %x, double %y, double %neg.z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v2, s18
; GFX8-NEXT: v_mov_b32_e32 v4, s20
; GFX8-NEXT: v_mov_b32_e32 v3, s19
; GFX8-NEXT: v_mov_b32_e32 v5, s21
; GFX8-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[4:5]
; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v2, s18
; GFX900-NEXT: v_mov_b32_e32 v4, s20
; GFX900-NEXT: v_mov_b32_e32 v3, s19
; GFX900-NEXT: v_mov_b32_e32 v5, s21
; GFX900-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[4:5]
; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[2:3]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[16:17]
; GFX942-NEXT: v_fma_f64 v[2:3], -s[0:1], -v[2:3], v[4:5]
; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX11-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[2:3], v[2:3]
; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX12-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[2:3], v[2:3]
; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.x = fneg double %x
%neg.y = fneg double %y
%val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_f64_fpexcept_strict_fneg_fneg_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5]
; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5]
; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5]
; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fneg_fneg_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[2:3], v[4:5]
; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.x = fneg double %x
%neg.y = fneg double %y
%val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni(double inreg %x, double inreg %y, double inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v2, s18
; GFX8-NEXT: v_mov_b32_e32 v4, s20
; GFX8-NEXT: v_mov_b32_e32 v3, s19
; GFX8-NEXT: v_mov_b32_e32 v5, s21
; GFX8-NEXT: v_fma_f64 v[2:3], |s[16:17]|, |v[2:3]|, v[4:5]
; GFX8-NEXT: flat_store_dwordx2 v[0:1], v[2:3]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v2, s18
; GFX900-NEXT: v_mov_b32_e32 v4, s20
; GFX900-NEXT: v_mov_b32_e32 v3, s19
; GFX900-NEXT: v_mov_b32_e32 v5, s21
; GFX900-NEXT: v_fma_f64 v[2:3], |s[16:17]|, |v[2:3]|, v[4:5]
; GFX900-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[2:3]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[16:17]
; GFX942-NEXT: v_fma_f64 v[2:3], |s[0:1]|, |v[2:3]|, v[4:5]
; GFX942-NEXT: global_store_dwordx2 v[0:1], v[2:3], off
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX11-NEXT: v_fma_f64 v[2:3], |s[0:1]|, |s[2:3]|, v[2:3]
; GFX11-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v2, s16 :: v_dual_mov_b32 v3, s17
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_1)
; GFX12-NEXT: v_fma_f64 v[2:3], |s[0:1]|, |s[2:3]|, v[2:3]
; GFX12-NEXT: global_store_b64 v[0:1], v[2:3], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.x = call double @llvm.fabs.f64(double %x) #0
%neg.y = call double @llvm.fabs.f64(double %y) #0
%val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_f64_fpexcept_strict_fabs_fabs_div(double %x, double %y, double %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5]
; GFX8-NEXT: flat_store_dwordx2 v[6:7], v[0:1]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5]
; GFX9-NEXT: global_store_dwordx2 v[6:7], v[0:1], off
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5]
; GFX11-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_f64_fpexcept_strict_fabs_fabs_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], |v[0:1]|, |v[2:3]|, v[4:5]
; GFX12-NEXT: global_store_b64 v[6:7], v[0:1], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.x = call double @llvm.fabs.f64(double %x) #0
%neg.y = call double @llvm.fabs.f64(double %y) #0
%val = call double @llvm.experimental.constrained.fma.f64(double %neg.x, double %neg.y, double %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store double %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni(<2 x double> inreg %x, <2 x double> inreg %y, <2 x double> inreg %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_mov_b32_e32 v2, s20
; GFX8-NEXT: v_mov_b32_e32 v6, s24
; GFX8-NEXT: v_mov_b32_e32 v3, s21
; GFX8-NEXT: v_mov_b32_e32 v7, s25
; GFX8-NEXT: v_mov_b32_e32 v4, s22
; GFX8-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[6:7]
; GFX8-NEXT: v_mov_b32_e32 v6, s26
; GFX8-NEXT: v_mov_b32_e32 v5, s23
; GFX8-NEXT: v_mov_b32_e32 v7, s27
; GFX8-NEXT: v_fma_f64 v[4:5], -s[18:19], -v[4:5], v[6:7]
; GFX8-NEXT: v_readfirstlane_b32 s4, v2
; GFX8-NEXT: v_readfirstlane_b32 s5, v3
; GFX8-NEXT: v_readfirstlane_b32 s6, v4
; GFX8-NEXT: v_readfirstlane_b32 s7, v5
; GFX8-NEXT: v_mov_b32_e32 v2, s4
; GFX8-NEXT: v_mov_b32_e32 v3, s5
; GFX8-NEXT: v_mov_b32_e32 v4, s6
; GFX8-NEXT: v_mov_b32_e32 v5, s7
; GFX8-NEXT: flat_store_dwordx4 v[0:1], v[2:5]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX900-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni:
; GFX900: ; %bb.0:
; GFX900-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX900-NEXT: v_mov_b32_e32 v2, s20
; GFX900-NEXT: v_mov_b32_e32 v6, s24
; GFX900-NEXT: v_mov_b32_e32 v3, s21
; GFX900-NEXT: v_mov_b32_e32 v7, s25
; GFX900-NEXT: v_mov_b32_e32 v4, s22
; GFX900-NEXT: v_fma_f64 v[2:3], -s[16:17], -v[2:3], v[6:7]
; GFX900-NEXT: v_mov_b32_e32 v6, s26
; GFX900-NEXT: v_mov_b32_e32 v5, s23
; GFX900-NEXT: v_mov_b32_e32 v7, s27
; GFX900-NEXT: v_fma_f64 v[4:5], -s[18:19], -v[4:5], v[6:7]
; GFX900-NEXT: v_readfirstlane_b32 s4, v2
; GFX900-NEXT: v_readfirstlane_b32 s5, v3
; GFX900-NEXT: v_readfirstlane_b32 s6, v4
; GFX900-NEXT: v_readfirstlane_b32 s7, v5
; GFX900-NEXT: v_mov_b32_e32 v2, s4
; GFX900-NEXT: v_mov_b32_e32 v3, s5
; GFX900-NEXT: v_mov_b32_e32 v4, s6
; GFX900-NEXT: v_mov_b32_e32 v5, s7
; GFX900-NEXT: global_store_dwordx4 v[0:1], v[2:5], off
; GFX900-NEXT: s_waitcnt vmcnt(0)
; GFX900-NEXT: s_setpc_b64 s[30:31]
;
; GFX942-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni:
; GFX942: ; %bb.0:
; GFX942-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[16:17]
; GFX942-NEXT: v_mov_b64_e32 v[6:7], s[20:21]
; GFX942-NEXT: v_fma_f64 v[2:3], -s[0:1], -v[2:3], v[6:7]
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[18:19]
; GFX942-NEXT: v_readfirstlane_b32 s0, v2
; GFX942-NEXT: v_readfirstlane_b32 s1, v3
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[22:23]
; GFX942-NEXT: v_fma_f64 v[2:3], -s[2:3], -v[4:5], v[2:3]
; GFX942-NEXT: s_nop 0
; GFX942-NEXT: v_readfirstlane_b32 s2, v2
; GFX942-NEXT: v_readfirstlane_b32 s3, v3
; GFX942-NEXT: s_nop 1
; GFX942-NEXT: v_mov_b64_e32 v[4:5], s[2:3]
; GFX942-NEXT: v_mov_b64_e32 v[2:3], s[0:1]
; GFX942-NEXT: global_store_dwordx4 v[0:1], v[2:5], off
; GFX942-NEXT: s_waitcnt vmcnt(0)
; GFX942-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23
; GFX11-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX11-NEXT: v_fma_f64 v[4:5], -s[2:3], -s[18:19], v[4:5]
; GFX11-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[16:17], v[2:3]
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX11-NEXT: v_readfirstlane_b32 s3, v5
; GFX11-NEXT: v_readfirstlane_b32 s2, v4
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4)
; GFX11-NEXT: v_readfirstlane_b32 s0, v2
; GFX11-NEXT: v_readfirstlane_b32 s1, v3
; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
; GFX11-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1
; GFX11-NEXT: global_store_b128 v[0:1], v[2:5], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_uni:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_dual_mov_b32 v4, s22 :: v_dual_mov_b32 v5, s23
; GFX12-NEXT: v_dual_mov_b32 v2, s20 :: v_dual_mov_b32 v3, s21
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX12-NEXT: v_fma_f64 v[4:5], -s[2:3], -s[18:19], v[4:5]
; GFX12-NEXT: v_fma_f64 v[2:3], -s[0:1], -s[16:17], v[2:3]
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_2) | instskip(NEXT) | instid1(VALU_DEP_3)
; GFX12-NEXT: v_readfirstlane_b32 s3, v5
; GFX12-NEXT: v_readfirstlane_b32 s2, v4
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_4)
; GFX12-NEXT: v_readfirstlane_b32 s0, v2
; GFX12-NEXT: v_readfirstlane_b32 s1, v3
; GFX12-NEXT: s_wait_alu depctr_va_sdst(0)
; GFX12-NEXT: s_delay_alu instid0(VALU_DEP_3) | instskip(NEXT) | instid1(VALU_DEP_2)
; GFX12-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
; GFX12-NEXT: v_dual_mov_b32 v2, s0 :: v_dual_mov_b32 v3, s1
; GFX12-NEXT: global_store_b128 v[0:1], v[2:5], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.x = fneg <2 x double> %x
%neg.y = fneg <2 x double> %y
%val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %neg.x, <2 x double> %neg.y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <2 x double> %val, ptr addrspace(1) %out
ret void
}
define void @v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div(<2 x double> %x, <2 x double> %y, <2 x double> %z, ptr addrspace(1) %out) #0 {
; GFX8-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div:
; GFX8: ; %bb.0:
; GFX8-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX8-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9]
; GFX8-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11]
; GFX8-NEXT: flat_store_dwordx4 v[12:13], v[0:3]
; GFX8-NEXT: s_waitcnt vmcnt(0)
; GFX8-NEXT: s_setpc_b64 s[30:31]
;
; GFX9-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9]
; GFX9-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11]
; GFX9-NEXT: global_store_dwordx4 v[12:13], v[0:3], off
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX11-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div:
; GFX11: ; %bb.0:
; GFX11-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX11-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9]
; GFX11-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11]
; GFX11-NEXT: global_store_b128 v[12:13], v[0:3], off
; GFX11-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v_constained_fma_v2f64_fpexcept_strict_fneg_fneg_div:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_fma_f64 v[0:1], -v[0:1], -v[4:5], v[8:9]
; GFX12-NEXT: v_fma_f64 v[2:3], -v[2:3], -v[6:7], v[10:11]
; GFX12-NEXT: global_store_b128 v[12:13], v[0:3], off
; GFX12-NEXT: s_setpc_b64 s[30:31]
%neg.x = fneg <2 x double> %x
%neg.y = fneg <2 x double> %y
%val = call <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double> %neg.x, <2 x double> %neg.y, <2 x double> %z, metadata !"round.tonearest", metadata !"fpexcept.strict")
store <2 x double> %val, ptr addrspace(1) %out
ret void
}
declare double @llvm.fabs.f64(double)
declare double @llvm.experimental.constrained.fma.f64(double, double, double, metadata, metadata)
declare <2 x double> @llvm.experimental.constrained.fma.v2f64(<2 x double>, <2 x double>, <2 x double>, metadata, metadata)
declare <3 x double> @llvm.experimental.constrained.fma.v3f64(<3 x double>, <3 x double>, <3 x double>, metadata, metadata)
declare <4 x double> @llvm.experimental.constrained.fma.v4f64(<4 x double>, <4 x double>, <4 x double>, metadata, metadata)
attributes #0 = { strictfp }