| ; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py UTC_ARGS: --version 6 |
| ; RUN: llc -mtriple=amdgpu9.0a-amd-amdhsa < %s | FileCheck --check-prefix=GFX9 %s |
| ; RUN: llc -mtriple=amdgpu12.00-amd-amdhsa < %s | FileCheck --check-prefix=GFX12 %s |
| |
| define i128 @i128_add_uniform_carry_to_divergent(i128 %x) #0 { |
| ; GFX9-LABEL: i128_add_uniform_carry_to_divergent: |
| ; GFX9: ; %bb.0: |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0) |
| ; GFX9-NEXT: s_mov_b32 s16, s33 |
| ; GFX9-NEXT: s_mov_b32 s33, s32 |
| ; GFX9-NEXT: s_or_saveexec_b64 s[18:19], -1 |
| ; GFX9-NEXT: buffer_store_dword v42, off, s[0:3], s33 offset:8 ; 4-byte Folded Spill |
| ; GFX9-NEXT: s_mov_b64 exec, s[18:19] |
| ; GFX9-NEXT: v_writelane_b32 v42, s16, 3 |
| ; GFX9-NEXT: s_add_i32 s32, s32, 0x400 |
| ; GFX9-NEXT: buffer_store_dword v40, off, s[0:3], s33 offset:4 ; 4-byte Folded Spill |
| ; GFX9-NEXT: buffer_store_dword v41, off, s[0:3], s33 ; 4-byte Folded Spill |
| ; GFX9-NEXT: v_writelane_b32 v42, s34, 0 |
| ; GFX9-NEXT: v_writelane_b32 v42, s30, 1 |
| ; GFX9-NEXT: v_writelane_b32 v42, s31, 2 |
| ; GFX9-NEXT: ; implicit-def: $vgpr2_vgpr3 |
| ; GFX9-NEXT: s_mov_b32 s34, 32 |
| ; GFX9-NEXT: v_lshlrev_b64 v[40:41], s34, v[0:1] |
| ; GFX9-NEXT: s_getpc_b64 s[16:17] |
| ; GFX9-NEXT: s_add_u32 s16, s16, external@gotpcrel32@lo+4 |
| ; GFX9-NEXT: s_addc_u32 s17, s17, external@gotpcrel32@hi+12 |
| ; GFX9-NEXT: s_load_dwordx2 s[16:17], s[16:17], 0x0 |
| ; GFX9-NEXT: s_waitcnt lgkmcnt(0) |
| ; GFX9-NEXT: s_swappc_b64 s[30:31], s[16:17] |
| ; GFX9-NEXT: s_mov_b64 s[4:5], 1 |
| ; GFX9-NEXT: s_mov_b64 s[6:7], 0 |
| ; GFX9-NEXT: s_add_u32 s4, s6, s4 |
| ; GFX9-NEXT: s_cselect_b64 s[8:9], -1, 0 |
| ; GFX9-NEXT: s_cmp_lg_u64 s[8:9], 0 |
| ; GFX9-NEXT: s_addc_u32 s5, s7, s5 |
| ; GFX9-NEXT: s_cselect_b64 s[8:9], -1, 0 |
| ; GFX9-NEXT: v_mov_b32_e32 v0, s6 |
| ; GFX9-NEXT: v_addc_co_u32_e64 v2, s[8:9], v40, v0, s[8:9] |
| ; GFX9-NEXT: v_mov_b32_e32 v0, s7 |
| ; GFX9-NEXT: v_addc_co_u32_e64 v3, s[6:7], v41, v0, s[8:9] |
| ; GFX9-NEXT: v_lshrrev_b64 v[4:5], s34, v[2:3] |
| ; GFX9-NEXT: s_lshr_b64 s[6:7], s[4:5], s34 |
| ; GFX9-NEXT: v_mov_b32_e32 v0, s4 |
| ; GFX9-NEXT: v_mov_b32_e32 v1, s6 |
| ; GFX9-NEXT: v_mov_b32_e32 v3, v4 |
| ; GFX9-NEXT: v_readlane_b32 s30, v42, 1 |
| ; GFX9-NEXT: v_readlane_b32 s31, v42, 2 |
| ; GFX9-NEXT: v_readlane_b32 s34, v42, 0 |
| ; GFX9-NEXT: buffer_load_dword v41, off, s[0:3], s33 ; 4-byte Folded Reload |
| ; GFX9-NEXT: buffer_load_dword v40, off, s[0:3], s33 offset:4 ; 4-byte Folded Reload |
| ; GFX9-NEXT: s_mov_b32 s32, s33 |
| ; GFX9-NEXT: v_readlane_b32 s4, v42, 3 |
| ; GFX9-NEXT: s_or_saveexec_b64 s[6:7], -1 |
| ; GFX9-NEXT: buffer_load_dword v42, off, s[0:3], s33 offset:8 ; 4-byte Folded Reload |
| ; GFX9-NEXT: s_mov_b64 exec, s[6:7] |
| ; GFX9-NEXT: s_mov_b32 s33, s4 |
| ; GFX9-NEXT: s_waitcnt vmcnt(0) |
| ; GFX9-NEXT: s_setpc_b64 s[30:31] |
| ; |
| ; GFX12-LABEL: i128_add_uniform_carry_to_divergent: |
| ; GFX12: ; %bb.0: |
| ; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0 |
| ; GFX12-NEXT: s_wait_expcnt 0x0 |
| ; GFX12-NEXT: s_wait_samplecnt 0x0 |
| ; GFX12-NEXT: s_wait_bvhcnt 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: s_mov_b32 s0, s33 |
| ; GFX12-NEXT: s_mov_b32 s33, s32 |
| ; GFX12-NEXT: s_or_saveexec_b32 s1, -1 |
| ; GFX12-NEXT: scratch_store_b32 off, v42, s33 offset:8 ; 4-byte Folded Spill |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_mov_b32 exec_lo, s1 |
| ; GFX12-NEXT: v_writelane_b32 v42, s0, 3 |
| ; GFX12-NEXT: s_add_co_i32 s32, s32, 16 |
| ; GFX12-NEXT: scratch_store_b32 off, v40, s33 offset:4 ; 4-byte Folded Spill |
| ; GFX12-NEXT: scratch_store_b32 off, v41, s33 ; 4-byte Folded Spill |
| ; GFX12-NEXT: v_writelane_b32 v42, s34, 0 |
| ; GFX12-NEXT: v_writelane_b32 v42, s30, 1 |
| ; GFX12-NEXT: v_writelane_b32 v42, s31, 2 |
| ; GFX12-NEXT: ; implicit-def: $vgpr2_vgpr3 |
| ; GFX12-NEXT: s_mov_b32 s34, 32 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: v_lshlrev_b64_e64 v[40:41], s34, v[0:1] |
| ; GFX12-NEXT: s_getpc_b64 s[0:1] |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_sext_i32_i16 s1, s1 |
| ; GFX12-NEXT: s_add_co_u32 s0, s0, external@gotpcrel32@lo+12 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_add_co_ci_u32 s1, s1, external@gotpcrel32@hi+24 |
| ; GFX12-NEXT: s_load_b64 s[0:1], s[0:1], 0x0 |
| ; GFX12-NEXT: s_wait_kmcnt 0x0 |
| ; GFX12-NEXT: s_swappc_b64 s[30:31], s[0:1] |
| ; GFX12-NEXT: s_mov_b64 s[0:1], 1 |
| ; GFX12-NEXT: s_mov_b64 s[2:3], 0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_add_co_u32 s0, s2, s0 |
| ; GFX12-NEXT: s_cselect_b32 s4, -1, 0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_cmp_lg_u32 s4, 0 |
| ; GFX12-NEXT: s_add_co_ci_u32 s1, s3, s1 |
| ; GFX12-NEXT: s_cselect_b32 s4, -1, 0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: v_add_co_ci_u32_e64 v2, s2, v40, s2, s4 |
| ; GFX12-NEXT: s_wait_alu depctr_va_sdst(0) |
| ; GFX12-NEXT: v_add_co_ci_u32_e64 v3, s2, v41, s3, s2 |
| ; GFX12-NEXT: v_lshrrev_b64 v[3:4], s34, v[2:3] |
| ; GFX12-NEXT: s_lshr_b64 s[2:3], s[0:1], s34 |
| ; GFX12-NEXT: v_mov_b32_e32 v0, s0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: v_mov_b32_e32 v1, s2 |
| ; GFX12-NEXT: v_readlane_b32 s30, v42, 1 |
| ; GFX12-NEXT: v_readlane_b32 s31, v42, 2 |
| ; GFX12-NEXT: v_readlane_b32 s34, v42, 0 |
| ; GFX12-NEXT: scratch_load_b32 v41, off, s33 ; 4-byte Folded Reload |
| ; GFX12-NEXT: scratch_load_b32 v40, off, s33 offset:4 ; 4-byte Folded Reload |
| ; GFX12-NEXT: s_mov_b32 s32, s33 |
| ; GFX12-NEXT: v_readlane_b32 s0, v42, 3 |
| ; GFX12-NEXT: s_or_saveexec_b32 s1, -1 |
| ; GFX12-NEXT: scratch_load_b32 v42, off, s33 offset:8 ; 4-byte Folded Reload |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_mov_b32 exec_lo, s1 |
| ; GFX12-NEXT: s_mov_b32 s33, s0 |
| ; GFX12-NEXT: s_wait_loadcnt 0x0 |
| ; GFX12-NEXT: s_wait_alu depctr_sa_sdst(0) |
| ; GFX12-NEXT: s_setpc_b64 s[30:31] |
| %shift = shl i128 %x, 96 |
| %call = call i32 @external() |
| %add = add i128 %shift, 1 |
| ret i128 %add |
| } |
| |
| declare i32 @external() |
| |
| attributes #0 = { noinline optnone } |