blob: faa4f1f20bf188d97456f98e222473f83b49d065 [file] [edit]
; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --version 6
; RUN: opt -S -mtriple=amdgpu9.00-amd-amdhsa -passes='amdgpu-atomic-optimizer<strategy=iterative>,verify<domtree>' %s | FileCheck --check-prefix=IR %s
; RUN: opt -S -mtriple=amdgpu9.00-amd-amdhsa -passes='amdgpu-atomic-optimizer<strategy=dpp>,verify<domtree>' %s | FileCheck --check-prefix=IR %s
; Folding a wavefront into a single atomic would change the number of volatile
; operations, so these must be left alone.
define amdgpu_kernel void @volatile_global(ptr addrspace(1) %out, ptr addrspace(1) %inout) {
; IR-LABEL: define amdgpu_kernel void @volatile_global(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(1) [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*:]]
; IR-NEXT: [[OLD:%.*]] = atomicrmw volatile add ptr addrspace(1) [[INOUT]], i32 5 syncscope("agent") acq_rel, align 4
; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = atomicrmw volatile add ptr addrspace(1) %inout, i32 5 syncscope("agent") acq_rel
store i32 %old, ptr addrspace(1) %out
ret void
}
define amdgpu_kernel void @volatile_local(ptr addrspace(1) %out, ptr addrspace(3) %inout) {
; IR-LABEL: define amdgpu_kernel void @volatile_local(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(3) [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*:]]
; IR-NEXT: [[OLD:%.*]] = atomicrmw volatile add ptr addrspace(3) [[INOUT]], i32 5 acq_rel, align 4
; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = atomicrmw volatile add ptr addrspace(3) %inout, i32 5 acq_rel
store i32 %old, ptr addrspace(1) %out
ret void
}
; A divergent value is the only case where the iterative and DPP strategies
; differ, so cover it too.
define amdgpu_kernel void @volatile_global_divergent(ptr addrspace(1) %out, ptr addrspace(1) %inout) {
; IR-LABEL: define amdgpu_kernel void @volatile_global_divergent(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(1) [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*:]]
; IR-NEXT: [[ID:%.*]] = call i32 @llvm.amdgcn.workitem.id.x()
; IR-NEXT: [[OLD:%.*]] = atomicrmw volatile add ptr addrspace(1) [[INOUT]], i32 [[ID]] syncscope("agent") acq_rel, align 4
; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%id = call i32 @llvm.amdgcn.workitem.id.x()
%old = atomicrmw volatile add ptr addrspace(1) %inout, i32 %id syncscope("agent") acq_rel
store i32 %old, ptr addrspace(1) %out
ret void
}
; Negative control: the same atomic without the volatile marker must be folded.
define amdgpu_kernel void @nonvolatile_global(ptr addrspace(1) %out, ptr addrspace(1) %inout) {
; IR-LABEL: define amdgpu_kernel void @nonvolatile_global(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(1) [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*]]:
; IR-NEXT: [[TMP0:%.*]] = call i64 @llvm.amdgcn.ballot.i64(i1 true)
; IR-NEXT: [[TMP1:%.*]] = trunc i64 [[TMP0]] to i32
; IR-NEXT: [[TMP2:%.*]] = lshr i64 [[TMP0]], 32
; IR-NEXT: [[TMP3:%.*]] = trunc i64 [[TMP2]] to i32
; IR-NEXT: [[TMP4:%.*]] = call i32 @llvm.amdgcn.mbcnt.lo(i32 [[TMP1]], i32 0)
; IR-NEXT: [[TMP5:%.*]] = call i32 @llvm.amdgcn.mbcnt.hi(i32 [[TMP3]], i32 [[TMP4]])
; IR-NEXT: [[TMP6:%.*]] = call i64 @llvm.ctpop.i64(i64 [[TMP0]])
; IR-NEXT: [[TMP7:%.*]] = trunc i64 [[TMP6]] to i32
; IR-NEXT: [[TMP8:%.*]] = mul i32 5, [[TMP7]]
; IR-NEXT: [[TMP9:%.*]] = icmp eq i32 [[TMP5]], 0
; IR-NEXT: br i1 [[TMP9]], label %[[BB10:.*]], label %[[BB12:.*]]
; IR: [[BB10]]:
; IR-NEXT: [[TMP11:%.*]] = atomicrmw add ptr addrspace(1) [[INOUT]], i32 [[TMP8]] syncscope("agent") acq_rel, align 4
; IR-NEXT: br label %[[BB12]]
; IR: [[BB12]]:
; IR-NEXT: [[TMP13:%.*]] = phi i32 [ poison, %[[ENTRY]] ], [ [[TMP11]], %[[BB10]] ]
; IR-NEXT: [[TMP14:%.*]] = call i32 @llvm.amdgcn.readfirstlane.i32(i32 [[TMP13]])
; IR-NEXT: [[TMP15:%.*]] = mul i32 5, [[TMP5]]
; IR-NEXT: [[TMP16:%.*]] = add i32 [[TMP14]], [[TMP15]]
; IR-NEXT: store i32 [[TMP16]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = atomicrmw add ptr addrspace(1) %inout, i32 5 syncscope("agent") acq_rel
store i32 %old, ptr addrspace(1) %out
ret void
}
; cachepolicy bit 31 is the volatile flag for buffer atomics. Its operand index
; differs between the raw and struct forms, and between the rsrc and pointer
; forms, so cover all four.
define amdgpu_kernel void @volatile_raw_ptr_buffer(ptr addrspace(1) %out, ptr addrspace(8) %inout) {
; IR-LABEL: define amdgpu_kernel void @volatile_raw_ptr_buffer(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(8) [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*:]]
; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add.i32(i32 5, ptr addrspace(8) [[INOUT]], i32 0, i32 0, i32 -2147483648)
; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add(i32 5, ptr addrspace(8) %inout, i32 0, i32 0, i32 -2147483648)
store i32 %old, ptr addrspace(1) %out
ret void
}
define amdgpu_kernel void @volatile_struct_ptr_buffer(ptr addrspace(1) %out, ptr addrspace(8) %inout) {
; IR-LABEL: define amdgpu_kernel void @volatile_struct_ptr_buffer(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(8) [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*:]]
; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.struct.ptr.buffer.atomic.add.i32(i32 5, ptr addrspace(8) [[INOUT]], i32 0, i32 0, i32 0, i32 -2147483648)
; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = call i32 @llvm.amdgcn.struct.ptr.buffer.atomic.add(i32 5, ptr addrspace(8) %inout, i32 0, i32 0, i32 0, i32 -2147483648)
store i32 %old, ptr addrspace(1) %out
ret void
}
define amdgpu_kernel void @volatile_raw_buffer(ptr addrspace(1) %out, <4 x i32> inreg %inout) {
; IR-LABEL: define amdgpu_kernel void @volatile_raw_buffer(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], <4 x i32> inreg [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*:]]
; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.raw.buffer.atomic.add.i32(i32 5, <4 x i32> [[INOUT]], i32 0, i32 0, i32 -2147483648)
; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = call i32 @llvm.amdgcn.raw.buffer.atomic.add(i32 5, <4 x i32> %inout, i32 0, i32 0, i32 -2147483648)
store i32 %old, ptr addrspace(1) %out
ret void
}
define amdgpu_kernel void @volatile_struct_buffer(ptr addrspace(1) %out, <4 x i32> inreg %inout) {
; IR-LABEL: define amdgpu_kernel void @volatile_struct_buffer(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], <4 x i32> inreg [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*:]]
; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.struct.buffer.atomic.add.i32(i32 5, <4 x i32> [[INOUT]], i32 0, i32 0, i32 0, i32 -2147483648)
; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = call i32 @llvm.amdgcn.struct.buffer.atomic.add(i32 5, <4 x i32> %inout, i32 0, i32 0, i32 0, i32 -2147483648)
store i32 %old, ptr addrspace(1) %out
ret void
}
; Negative control: only bit 31 means volatile, so a plain cachepolicy bit must
; not block the optimization.
define amdgpu_kernel void @nonvolatile_raw_ptr_buffer(ptr addrspace(1) %out, ptr addrspace(8) %inout) {
; IR-LABEL: define amdgpu_kernel void @nonvolatile_raw_ptr_buffer(
; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(8) [[INOUT:%.*]]) {
; IR-NEXT: [[ENTRY:.*]]:
; IR-NEXT: [[TMP0:%.*]] = call i64 @llvm.amdgcn.ballot.i64(i1 true)
; IR-NEXT: [[TMP1:%.*]] = trunc i64 [[TMP0]] to i32
; IR-NEXT: [[TMP2:%.*]] = lshr i64 [[TMP0]], 32
; IR-NEXT: [[TMP3:%.*]] = trunc i64 [[TMP2]] to i32
; IR-NEXT: [[TMP4:%.*]] = call i32 @llvm.amdgcn.mbcnt.lo(i32 [[TMP1]], i32 0)
; IR-NEXT: [[TMP5:%.*]] = call i32 @llvm.amdgcn.mbcnt.hi(i32 [[TMP3]], i32 [[TMP4]])
; IR-NEXT: [[TMP6:%.*]] = call i64 @llvm.ctpop.i64(i64 [[TMP0]])
; IR-NEXT: [[TMP7:%.*]] = trunc i64 [[TMP6]] to i32
; IR-NEXT: [[TMP8:%.*]] = mul i32 5, [[TMP7]]
; IR-NEXT: [[TMP9:%.*]] = icmp eq i32 [[TMP5]], 0
; IR-NEXT: br i1 [[TMP9]], label %[[BB10:.*]], label %[[BB12:.*]]
; IR: [[BB10]]:
; IR-NEXT: [[TMP11:%.*]] = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add.i32(i32 [[TMP8]], ptr addrspace(8) [[INOUT]], i32 0, i32 0, i32 1)
; IR-NEXT: br label %[[BB12]]
; IR: [[BB12]]:
; IR-NEXT: [[TMP13:%.*]] = phi i32 [ poison, %[[ENTRY]] ], [ [[TMP11]], %[[BB10]] ]
; IR-NEXT: [[TMP14:%.*]] = call i32 @llvm.amdgcn.readfirstlane.i32(i32 [[TMP13]])
; IR-NEXT: [[TMP15:%.*]] = mul i32 5, [[TMP5]]
; IR-NEXT: [[TMP16:%.*]] = add i32 [[TMP14]], [[TMP15]]
; IR-NEXT: store i32 [[TMP16]], ptr addrspace(1) [[OUT]], align 4
; IR-NEXT: ret void
;
entry:
%old = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add(i32 5, ptr addrspace(8) %inout, i32 0, i32 0, i32 1)
store i32 %old, ptr addrspace(1) %out
ret void
}