blob: d2ad66f3f3f044ac7d64f2cc86091c9411f337d4 [file] [edit]
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py UTC_ARGS: --version 6
; RUN: llc -mtriple=amdgpu9.42-amd-amdhsa < %s | FileCheck -check-prefixes=GFX9 %s
; RUN: llc -mtriple=amdgpu12.50-amd-amdhsa < %s | FileCheck -check-prefixes=GFX12 %s
; Test showing when extractelement from v16i8/v8i8/v4i8 is free (no instructions)
; versus when it generates shift instructions (cost > 0).
@lds = external addrspace(3) global [0 x i8], align 16
; =============================================================================
; v16i8 extracts - comparing free (aligned) vs non-free (shifts required)
; =============================================================================
; FREE: Extract at index 0 - low byte of first i32, no shift
define i8 @v16i8_extract_index_0() {
; GFX9-LABEL: v16i8_extract_index_0:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_0:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 0
ret i8 %e
}
; NOT FREE: Extract at index 1 - requires shift right by 8 bits
define i8 @v16i8_extract_index_1() {
; GFX9-LABEL: v16i8_extract_index_1:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_1:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 1
ret i8 %e
}
; NOT FREE: Extract at index 2 - requires shift right by 16 bits
define i8 @v16i8_extract_index_2() {
; GFX9-LABEL: v16i8_extract_index_2:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 16, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_2:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 16, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 2
ret i8 %e
}
; NOT FREE: Extract at index 3 - requires shift right by 24 bits
define i8 @v16i8_extract_index_3() {
; GFX9-LABEL: v16i8_extract_index_3:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_3:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 3
ret i8 %e
}
; FREE: Extract at index 4 - low byte of second i32, no shift
define i8 @v16i8_extract_index_4() {
; GFX9-LABEL: v16i8_extract_index_4:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0 offset:4
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_4:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0 offset:4
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 4
ret i8 %e
}
; NOT FREE: Extract at index 5 - requires shift right by 8 bits from second i32
define i8 @v16i8_extract_index_5() {
; GFX9-LABEL: v16i8_extract_index_5:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0 offset:4
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_5:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0 offset:4
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 5
ret i8 %e
}
; FREE: Extract at index 8 - low byte of third i32, no shift
define i8 @v16i8_extract_index_8() {
; GFX9-LABEL: v16i8_extract_index_8:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0 offset:8
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_8:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0 offset:8
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 8
ret i8 %e
}
; FREE: Extract at index 12 - low byte of fourth i32, no shift
define i8 @v16i8_extract_index_12() {
; GFX9-LABEL: v16i8_extract_index_12:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0 offset:12
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_12:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0 offset:12
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 12
ret i8 %e
}
; NOT FREE: Extract at index 15 - requires shift right by 24 bits from fourth i32
define i8 @v16i8_extract_index_15() {
; GFX9-LABEL: v16i8_extract_index_15:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0 offset:12
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v16i8_extract_index_15:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0 offset:12
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <16 x i8>, ptr addrspace(3) %ptr, align 16
%e = extractelement <16 x i8> %val, i32 15
ret i8 %e
}
; =============================================================================
; v8i8 extracts - comparing free (aligned) vs non-free (shifts required)
; =============================================================================
; FREE: Extract at index 0 from v8i8 - low byte of first i32, no shift
define i8 @v8i8_extract_index_0() {
; GFX9-LABEL: v8i8_extract_index_0:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v8i8_extract_index_0:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <8 x i8>, ptr addrspace(3) %ptr, align 8
%e = extractelement <8 x i8> %val, i32 0
ret i8 %e
}
; NOT FREE: Extract at index 1 from v8i8 - requires shift
define i8 @v8i8_extract_index_1() {
; GFX9-LABEL: v8i8_extract_index_1:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v8i8_extract_index_1:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <8 x i8>, ptr addrspace(3) %ptr, align 8
%e = extractelement <8 x i8> %val, i32 1
ret i8 %e
}
; FREE: Extract at index 4 from v8i8 - low byte of second i32, no shift
define i8 @v8i8_extract_index_4() {
; GFX9-LABEL: v8i8_extract_index_4:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0 offset:4
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v8i8_extract_index_4:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0 offset:4
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <8 x i8>, ptr addrspace(3) %ptr, align 8
%e = extractelement <8 x i8> %val, i32 4
ret i8 %e
}
; NOT FREE: Extract at index 7 from v8i8 - requires shift
define i8 @v8i8_extract_index_7() {
; GFX9-LABEL: v8i8_extract_index_7:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0 offset:4
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v8i8_extract_index_7:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0 offset:4
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <8 x i8>, ptr addrspace(3) %ptr, align 8
%e = extractelement <8 x i8> %val, i32 7
ret i8 %e
}
; =============================================================================
; v4i8 extracts - index 0 is free, others require shifts
; =============================================================================
; FREE: Extract at index 0 from v4i8 - low byte, no shift
define i8 @v4i8_extract_index_0() {
; GFX9-LABEL: v4i8_extract_index_0:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v4i8_extract_index_0:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <4 x i8>, ptr addrspace(3) %ptr, align 4
%e = extractelement <4 x i8> %val, i32 0
ret i8 %e
}
; NOT FREE: Extract at index 1 from v4i8 - requires shift
define i8 @v4i8_extract_index_1() {
; GFX9-LABEL: v4i8_extract_index_1:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v4i8_extract_index_1:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 8, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <4 x i8>, ptr addrspace(3) %ptr, align 4
%e = extractelement <4 x i8> %val, i32 1
ret i8 %e
}
; NOT FREE: Extract at index 3 from v4i8 - requires shift
define i8 @v4i8_extract_index_3() {
; GFX9-LABEL: v4i8_extract_index_3:
; GFX9: ; %bb.0:
; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, 0
; GFX9-NEXT: ds_read_b32 v0, v0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX9-NEXT: s_setpc_b64 s[30:31]
;
; GFX12-LABEL: v4i8_extract_index_3:
; GFX12: ; %bb.0:
; GFX12-NEXT: s_wait_loadcnt_dscnt 0x0
; GFX12-NEXT: s_wait_kmcnt 0x0
; GFX12-NEXT: v_mov_b32_e32 v0, 0
; GFX12-NEXT: ds_load_b32 v0, v0
; GFX12-NEXT: s_wait_dscnt 0x0
; GFX12-NEXT: v_lshrrev_b32_e32 v0, 24, v0
; GFX12-NEXT: s_set_pc_i64 s[30:31]
%ptr = getelementptr inbounds i8, ptr addrspace(3) @lds, i32 0
%val = load <4 x i8>, ptr addrspace(3) %ptr, align 4
%e = extractelement <4 x i8> %val, i32 3
ret i8 %e
}