blob: 2a8b9e38b9057e6846636a24d87668880e59a3c0 [file] [edit]
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py UTC_ARGS: --version 6
; RUN: llc -mtriple=amdgpu9.0a-amd-amdhsa < %s | FileCheck --check-prefix=GFX9 %s
; RUN: llc -mtriple=amdgpu12.00-amd-amdhsa < %s | FileCheck --check-prefix=GFX12 %s
define i128 @i128_add_uniform_carry_to_divergent(i128 %x) #0 {
; GFX9-LABEL: i128_add_uniform_carry_to_divergent:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: s_mov_b32 s16, s33
; GFX9-NEXT: s_mov_b32 s33, s32
; GFX9-NEXT: s_or_saveexec_b64 s[18:19], -1
; GFX9-NEXT: buffer_store_dword v42, off, s[0:3], s33 offset:8 ; 4-byte Folded Spill
; GFX9-NEXT: s_mov_b64 exec, s[18:19]
; GFX9-NEXT: v_writelane_b32 v42, s16, 3
; GFX9-NEXT: s_add_i32 s32, s32, 0x400
; GFX9-NEXT: buffer_store_dword v40, off, s[0:3], s33 offset:4 ; 4-byte Folded Spill
; GFX9-NEXT: buffer_store_dword v41, off, s[0:3], s33 ; 4-byte Folded Spill
; GFX9-NEXT: v_writelane_b32 v42, s34, 0
; GFX9-NEXT: v_writelane_b32 v42, s30, 1
; GFX9-NEXT: v_writelane_b32 v42, s31, 2
; GFX9-NEXT: ; implicit-def: $vgpr2_vgpr3
; GFX9-NEXT: s_mov_b32 s34, 32
; GFX9-NEXT: v_lshlrev_b64 v[40:41], s34, v[0:1]
; GFX9-NEXT: s_getpc_b64 s[16:17]
; GFX9-NEXT: s_add_u32 s16, s16, external@gotpcrel32@lo+4
; GFX9-NEXT: s_addc_u32 s17, s17, external@gotpcrel32@hi+12
; GFX9-NEXT: s_load_dwordx2 s[16:17], s[16:17], 0x0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_swappc_b64 s[30:31], s[16:17]
; GFX9-NEXT: s_mov_b64 s[4:5], 1
; GFX9-NEXT: s_mov_b64 s[6:7], 0
; GFX9-NEXT: s_add_u32 s4, s6, s4
; GFX9-NEXT: s_cselect_b64 s[8:9], -1, 0
; GFX9-NEXT: s_cmp_lg_u64 s[8:9], 0
; GFX9-NEXT: s_addc_u32 s5, s7, s5
; GFX9-NEXT: s_cselect_b64 s[8:9], -1, 0
; GFX9-NEXT: v_mov_b32_e32 v0, s6
; GFX9-NEXT: v_addc_co_u32_e64 v2, s[8:9], v40, v0, s[8:9]
; GFX9-NEXT: v_mov_b32_e32 v0, s7
; GFX9-NEXT: v_addc_co_u32_e64 v3, s[6:7], v41, v0, s[8:9]
; GFX9-NEXT: v_lshrrev_b64 v[4:5], s34, v[2:3]
; GFX9-NEXT: s_lshr_b64 s[6:7], s[4:5], s34
; GFX9-NEXT: v_mov_b32_e32 v0, s4
; GFX9-NEXT: v_mov_b32_e32 v1, s6
; GFX9-NEXT: v_mov_b32_e32 v3, v4
; GFX9-NEXT: v_readlane_b32 s30, v42, 1
; GFX9-NEXT: v_readlane_b32 s31, v42, 2
; GFX9-NEXT: v_readlane_b32 s34, v42, 0
; GFX9-NEXT: buffer_load_dword v41, off, s[0:3], s33 ; 4-byte Folded Reload
; GFX9-NEXT: buffer_load_dword v40, off, s[0:3], s33 offset:4 ; 4-byte Folded Reload
; GFX9-NEXT: s_mov_b32 s32, s33
; GFX9-NEXT: v_readlane_b32 s4, v42, 3
; GFX9-NEXT: s_or_saveexec_b64 s[6:7], -1
; GFX9-NEXT: buffer_load_dword v42, off, s[0:3], s33 offset:8 ; 4-byte Folded Reload
; GFX9-NEXT: s_mov_b64 exec, s[6:7]
; GFX9-NEXT: s_mov_b32 s33, s4
; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: i128_add_uniform_carry_to_divergent:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_expcnt 0x0
; GFX12-NEXT: s_wait_samplecnt 0x0
; GFX12-NEXT: s_wait_bvhcnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: s_mov_b32 s0, s33
; GFX12-NEXT: s_mov_b32 s33, s32
; GFX12-NEXT: s_or_saveexec_b32 s1, -1
; GFX12-NEXT: scratch_store_b32 off, v42, s33 offset:8 ; 4-byte Folded Spill
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: s_mov_b32 exec_lo, s1
; GFX12-NEXT: v_writelane_b32 v42, s0, 3
; GFX12-NEXT: s_add_co_i32 s32, s32, 16
; GFX12-NEXT: scratch_store_b32 off, v40, s33 offset:4 ; 4-byte Folded Spill
; GFX12-NEXT: scratch_store_b32 off, v41, s33 ; 4-byte Folded Spill
; GFX12-NEXT: v_writelane_b32 v42, s34, 0
; GFX12-NEXT: v_writelane_b32 v42, s30, 1
; GFX12-NEXT: v_writelane_b32 v42, s31, 2
; GFX12-NEXT: ; implicit-def: $vgpr2_vgpr3
; GFX12-NEXT: s_mov_b32 s34, 32
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: v_lshlrev_b64_e64 v[40:41], s34, v[0:1]
; GFX12-NEXT: s_getpc_b64 s[0:1]
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: s_sext_i32_i16 s1, s1
; GFX12-NEXT: s_add_co_u32 s0, s0, external@gotpcrel32@lo+12
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: s_add_co_ci_u32 s1, s1, external@gotpcrel32@hi+24
; GFX12-NEXT: s_load_b64 s[0:1], s[0:1], 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: s_swappc_b64 s[30:31], s[0:1]
; GFX12-NEXT: s_mov_b64 s[0:1], 1
; GFX12-NEXT: s_mov_b64 s[2:3], 0
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: s_add_co_u32 s0, s2, s0
; GFX12-NEXT: s_cselect_b32 s4, -1, 0
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: s_cmp_lg_u32 s4, 0
; GFX12-NEXT: s_add_co_ci_u32 s1, s3, s1
; GFX12-NEXT: s_cselect_b32 s4, -1, 0
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: v_add_co_ci_u32_e64 v2, s2, v40, s2, s4
; GFX12-NEXT: s_wait_alu depctr_va_sdst(0)
; GFX12-NEXT: v_add_co_ci_u32_e64 v3, s2, v41, s3, s2
; GFX12-NEXT: v_lshrrev_b64 v[3:4], s34, v[2:3]
; GFX12-NEXT: s_lshr_b64 s[2:3], s[0:1], s34
; GFX12-NEXT: v_mov_b32_e32 v0, s0
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: v_mov_b32_e32 v1, s2
; GFX12-NEXT: v_readlane_b32 s30, v42, 1
; GFX12-NEXT: v_readlane_b32 s31, v42, 2
; GFX12-NEXT: v_readlane_b32 s34, v42, 0
; GFX12-NEXT: scratch_load_b32 v41, off, s33 ; 4-byte Folded Reload
; GFX12-NEXT: scratch_load_b32 v40, off, s33 offset:4 ; 4-byte Folded Reload
; GFX12-NEXT: s_mov_b32 s32, s33
; GFX12-NEXT: v_readlane_b32 s0, v42, 3
; GFX12-NEXT: s_or_saveexec_b32 s1, -1
; GFX12-NEXT: scratch_load_b32 v42, off, s33 offset:8 ; 4-byte Folded Reload
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: s_mov_b32 exec_lo, s1
; GFX12-NEXT: s_mov_b32 s33, s0
; GFX12-NEXT: s_wait_loadcnt 0x0
; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0)
; GFX12-NEXT: s_setpc_b64 s[30:31]
%shift = shl i128 %x, 96
%call = call i32 @external()
%add = add i128 %shift, 1
ret i128 %add
}
declare i32 @external()
attributes #0 = { noinline optnone }