| ; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --version 6 |
| ; RUN: opt -S -mtriple=amdgpu9.00-amd-amdhsa -passes='amdgpu-atomic-optimizer<strategy=iterative>,verify<domtree>' %s | FileCheck --check-prefix=IR %s |
| ; RUN: opt -S -mtriple=amdgpu9.00-amd-amdhsa -passes='amdgpu-atomic-optimizer<strategy=dpp>,verify<domtree>' %s | FileCheck --check-prefix=IR %s |
| |
| ; Folding a wavefront into a single atomic would change the number of volatile |
| ; operations, so these must be left alone. |
| |
| define amdgpu_kernel void @volatile_global(ptr addrspace(1) %out, ptr addrspace(1) %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @volatile_global( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(1) [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*:]] |
| ; IR-NEXT: [[OLD:%.*]] = atomicrmw volatile add ptr addrspace(1) [[INOUT]], i32 5 syncscope("agent") acq_rel, align 4 |
| ; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = atomicrmw volatile add ptr addrspace(1) %inout, i32 5 syncscope("agent") acq_rel |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define amdgpu_kernel void @volatile_local(ptr addrspace(1) %out, ptr addrspace(3) %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @volatile_local( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(3) [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*:]] |
| ; IR-NEXT: [[OLD:%.*]] = atomicrmw volatile add ptr addrspace(3) [[INOUT]], i32 5 acq_rel, align 4 |
| ; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = atomicrmw volatile add ptr addrspace(3) %inout, i32 5 acq_rel |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| ; A divergent value is the only case where the iterative and DPP strategies |
| ; differ, so cover it too. |
| define amdgpu_kernel void @volatile_global_divergent(ptr addrspace(1) %out, ptr addrspace(1) %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @volatile_global_divergent( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(1) [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*:]] |
| ; IR-NEXT: [[ID:%.*]] = call i32 @llvm.amdgcn.workitem.id.x() |
| ; IR-NEXT: [[OLD:%.*]] = atomicrmw volatile add ptr addrspace(1) [[INOUT]], i32 [[ID]] syncscope("agent") acq_rel, align 4 |
| ; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %id = call i32 @llvm.amdgcn.workitem.id.x() |
| %old = atomicrmw volatile add ptr addrspace(1) %inout, i32 %id syncscope("agent") acq_rel |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| ; Negative control: the same atomic without the volatile marker must be folded. |
| define amdgpu_kernel void @nonvolatile_global(ptr addrspace(1) %out, ptr addrspace(1) %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @nonvolatile_global( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(1) [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*]]: |
| ; IR-NEXT: [[TMP0:%.*]] = call i64 @llvm.amdgcn.ballot.i64(i1 true) |
| ; IR-NEXT: [[TMP1:%.*]] = trunc i64 [[TMP0]] to i32 |
| ; IR-NEXT: [[TMP2:%.*]] = lshr i64 [[TMP0]], 32 |
| ; IR-NEXT: [[TMP3:%.*]] = trunc i64 [[TMP2]] to i32 |
| ; IR-NEXT: [[TMP4:%.*]] = call i32 @llvm.amdgcn.mbcnt.lo(i32 [[TMP1]], i32 0) |
| ; IR-NEXT: [[TMP5:%.*]] = call i32 @llvm.amdgcn.mbcnt.hi(i32 [[TMP3]], i32 [[TMP4]]) |
| ; IR-NEXT: [[TMP6:%.*]] = call i64 @llvm.ctpop.i64(i64 [[TMP0]]) |
| ; IR-NEXT: [[TMP7:%.*]] = trunc i64 [[TMP6]] to i32 |
| ; IR-NEXT: [[TMP8:%.*]] = mul i32 5, [[TMP7]] |
| ; IR-NEXT: [[TMP9:%.*]] = icmp eq i32 [[TMP5]], 0 |
| ; IR-NEXT: br i1 [[TMP9]], label %[[BB10:.*]], label %[[BB12:.*]] |
| ; IR: [[BB10]]: |
| ; IR-NEXT: [[TMP11:%.*]] = atomicrmw add ptr addrspace(1) [[INOUT]], i32 [[TMP8]] syncscope("agent") acq_rel, align 4 |
| ; IR-NEXT: br label %[[BB12]] |
| ; IR: [[BB12]]: |
| ; IR-NEXT: [[TMP13:%.*]] = phi i32 [ poison, %[[ENTRY]] ], [ [[TMP11]], %[[BB10]] ] |
| ; IR-NEXT: [[TMP14:%.*]] = call i32 @llvm.amdgcn.readfirstlane.i32(i32 [[TMP13]]) |
| ; IR-NEXT: [[TMP15:%.*]] = mul i32 5, [[TMP5]] |
| ; IR-NEXT: [[TMP16:%.*]] = add i32 [[TMP14]], [[TMP15]] |
| ; IR-NEXT: store i32 [[TMP16]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = atomicrmw add ptr addrspace(1) %inout, i32 5 syncscope("agent") acq_rel |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| ; cachepolicy bit 31 is the volatile flag for buffer atomics. Its operand index |
| ; differs between the raw and struct forms, and between the rsrc and pointer |
| ; forms, so cover all four. |
| define amdgpu_kernel void @volatile_raw_ptr_buffer(ptr addrspace(1) %out, ptr addrspace(8) %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @volatile_raw_ptr_buffer( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(8) [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*:]] |
| ; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add.i32(i32 5, ptr addrspace(8) [[INOUT]], i32 0, i32 0, i32 -2147483648) |
| ; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add(i32 5, ptr addrspace(8) %inout, i32 0, i32 0, i32 -2147483648) |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define amdgpu_kernel void @volatile_struct_ptr_buffer(ptr addrspace(1) %out, ptr addrspace(8) %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @volatile_struct_ptr_buffer( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(8) [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*:]] |
| ; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.struct.ptr.buffer.atomic.add.i32(i32 5, ptr addrspace(8) [[INOUT]], i32 0, i32 0, i32 0, i32 -2147483648) |
| ; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = call i32 @llvm.amdgcn.struct.ptr.buffer.atomic.add(i32 5, ptr addrspace(8) %inout, i32 0, i32 0, i32 0, i32 -2147483648) |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define amdgpu_kernel void @volatile_raw_buffer(ptr addrspace(1) %out, <4 x i32> inreg %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @volatile_raw_buffer( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], <4 x i32> inreg [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*:]] |
| ; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.raw.buffer.atomic.add.i32(i32 5, <4 x i32> [[INOUT]], i32 0, i32 0, i32 -2147483648) |
| ; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = call i32 @llvm.amdgcn.raw.buffer.atomic.add(i32 5, <4 x i32> %inout, i32 0, i32 0, i32 -2147483648) |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| define amdgpu_kernel void @volatile_struct_buffer(ptr addrspace(1) %out, <4 x i32> inreg %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @volatile_struct_buffer( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], <4 x i32> inreg [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*:]] |
| ; IR-NEXT: [[OLD:%.*]] = call i32 @llvm.amdgcn.struct.buffer.atomic.add.i32(i32 5, <4 x i32> [[INOUT]], i32 0, i32 0, i32 0, i32 -2147483648) |
| ; IR-NEXT: store i32 [[OLD]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = call i32 @llvm.amdgcn.struct.buffer.atomic.add(i32 5, <4 x i32> %inout, i32 0, i32 0, i32 0, i32 -2147483648) |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |
| |
| ; Negative control: only bit 31 means volatile, so a plain cachepolicy bit must |
| ; not block the optimization. |
| define amdgpu_kernel void @nonvolatile_raw_ptr_buffer(ptr addrspace(1) %out, ptr addrspace(8) %inout) { |
| ; IR-LABEL: define amdgpu_kernel void @nonvolatile_raw_ptr_buffer( |
| ; IR-SAME: ptr addrspace(1) [[OUT:%.*]], ptr addrspace(8) [[INOUT:%.*]]) { |
| ; IR-NEXT: [[ENTRY:.*]]: |
| ; IR-NEXT: [[TMP0:%.*]] = call i64 @llvm.amdgcn.ballot.i64(i1 true) |
| ; IR-NEXT: [[TMP1:%.*]] = trunc i64 [[TMP0]] to i32 |
| ; IR-NEXT: [[TMP2:%.*]] = lshr i64 [[TMP0]], 32 |
| ; IR-NEXT: [[TMP3:%.*]] = trunc i64 [[TMP2]] to i32 |
| ; IR-NEXT: [[TMP4:%.*]] = call i32 @llvm.amdgcn.mbcnt.lo(i32 [[TMP1]], i32 0) |
| ; IR-NEXT: [[TMP5:%.*]] = call i32 @llvm.amdgcn.mbcnt.hi(i32 [[TMP3]], i32 [[TMP4]]) |
| ; IR-NEXT: [[TMP6:%.*]] = call i64 @llvm.ctpop.i64(i64 [[TMP0]]) |
| ; IR-NEXT: [[TMP7:%.*]] = trunc i64 [[TMP6]] to i32 |
| ; IR-NEXT: [[TMP8:%.*]] = mul i32 5, [[TMP7]] |
| ; IR-NEXT: [[TMP9:%.*]] = icmp eq i32 [[TMP5]], 0 |
| ; IR-NEXT: br i1 [[TMP9]], label %[[BB10:.*]], label %[[BB12:.*]] |
| ; IR: [[BB10]]: |
| ; IR-NEXT: [[TMP11:%.*]] = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add.i32(i32 [[TMP8]], ptr addrspace(8) [[INOUT]], i32 0, i32 0, i32 1) |
| ; IR-NEXT: br label %[[BB12]] |
| ; IR: [[BB12]]: |
| ; IR-NEXT: [[TMP13:%.*]] = phi i32 [ poison, %[[ENTRY]] ], [ [[TMP11]], %[[BB10]] ] |
| ; IR-NEXT: [[TMP14:%.*]] = call i32 @llvm.amdgcn.readfirstlane.i32(i32 [[TMP13]]) |
| ; IR-NEXT: [[TMP15:%.*]] = mul i32 5, [[TMP5]] |
| ; IR-NEXT: [[TMP16:%.*]] = add i32 [[TMP14]], [[TMP15]] |
| ; IR-NEXT: store i32 [[TMP16]], ptr addrspace(1) [[OUT]], align 4 |
| ; IR-NEXT: ret void |
| ; |
| entry: |
| %old = call i32 @llvm.amdgcn.raw.ptr.buffer.atomic.add(i32 5, ptr addrspace(8) %inout, i32 0, i32 0, i32 1) |
| store i32 %old, ptr addrspace(1) %out |
| ret void |
| } |