| ; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -mcpu=x86-64 | FileCheck %s --check-prefixes=CHECK,CHECK-O3,CHECK-SSE-O3,CHECK-SSE2-O3 |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -mcpu=x86-64-v2 | FileCheck %s --check-prefixes=CHECK,CHECK-O3,CHECK-SSE-O3,CHECK-SSE4-O3 |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -mcpu=x86-64-v3 | FileCheck %s --check-prefixes=CHECK,CHECK-O3,CHECK-AVX-O3,CHECK-AVX2-O3 |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -mcpu=x86-64-v4 | FileCheck %s --check-prefixes=CHECK,CHECK-O3,CHECK-AVX-O3,CHECK-AVX512-O3 |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -O0 -mcpu=x86-64 | FileCheck %s --check-prefixes=CHECK,CHECK-O0,CHECK-SSE-O0,CHECK-SSE2-O0 |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -O0 -mcpu=x86-64-v2 | FileCheck %s --check-prefixes=CHECK,CHECK-O0,CHECK-SSE-O0,CHECK-SSE4-O0 |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -O0 -mcpu=x86-64-v3 | FileCheck %s --check-prefixes=CHECK,CHECK-O0,CHECK-AVX-O0,CHECK-AVX2-O0 |
| ; RUN: llc < %s -mtriple=x86_64-- -verify-machineinstrs -O0 -mcpu=x86-64-v4 | FileCheck %s --check-prefixes=CHECK,CHECK-O0,CHECK-AVX-O0,CHECK-AVX512-O0 |
| |
| define void @test1(ptr %ptr, i32 %val1) { |
| ; CHECK-LABEL: test1: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: xchgl %esi, (%rdi) |
| ; CHECK-NEXT: retq |
| store atomic i32 %val1, ptr %ptr seq_cst, align 4 |
| ret void |
| } |
| |
| define void @test2(ptr %ptr, i32 %val1) { |
| ; CHECK-LABEL: test2: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movl %esi, (%rdi) |
| ; CHECK-NEXT: retq |
| store atomic i32 %val1, ptr %ptr release, align 4 |
| ret void |
| } |
| |
| define i32 @test3(ptr %ptr) { |
| ; CHECK-LABEL: test3: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movl (%rdi), %eax |
| ; CHECK-NEXT: retq |
| %val = load atomic i32, ptr %ptr seq_cst, align 4 |
| ret i32 %val |
| } |
| |
| define <1 x i32> @atomic_vec1_i32(ptr %x) { |
| ; CHECK-LABEL: atomic_vec1_i32: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movl (%rdi), %eax |
| ; CHECK-NEXT: retq |
| %ret = load atomic <1 x i32>, ptr %x acquire, align 4 |
| ret <1 x i32> %ret |
| } |
| |
| define <1 x i8> @atomic_vec1_i8(ptr %x) { |
| ; CHECK-O3-LABEL: atomic_vec1_i8: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: movzbl (%rdi), %eax |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: atomic_vec1_i8: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: movb (%rdi), %al |
| ; CHECK-O0-NEXT: retq |
| %ret = load atomic <1 x i8>, ptr %x acquire, align 1 |
| ret <1 x i8> %ret |
| } |
| |
| define <1 x i16> @atomic_vec1_i16(ptr %x) { |
| ; CHECK-O3-LABEL: atomic_vec1_i16: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: atomic_vec1_i16: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: movw (%rdi), %ax |
| ; CHECK-O0-NEXT: retq |
| %ret = load atomic <1 x i16>, ptr %x acquire, align 2 |
| ret <1 x i16> %ret |
| } |
| |
| define <1 x i32> @atomic_vec1_i8_zext(ptr %x) { |
| ; CHECK-O3-LABEL: atomic_vec1_i8_zext: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: movzbl (%rdi), %eax |
| ; CHECK-O3-NEXT: movzbl %al, %eax |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: atomic_vec1_i8_zext: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: movb (%rdi), %al |
| ; CHECK-O0-NEXT: movzbl %al, %eax |
| ; CHECK-O0-NEXT: retq |
| %ret = load atomic <1 x i8>, ptr %x acquire, align 1 |
| %zret = zext <1 x i8> %ret to <1 x i32> |
| ret <1 x i32> %zret |
| } |
| |
| define <1 x i64> @atomic_vec1_i16_sext(ptr %x) { |
| ; CHECK-O3-LABEL: atomic_vec1_i16_sext: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-O3-NEXT: movswq %ax, %rax |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: atomic_vec1_i16_sext: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: movw (%rdi), %ax |
| ; CHECK-O0-NEXT: movswq %ax, %rax |
| ; CHECK-O0-NEXT: retq |
| %ret = load atomic <1 x i16>, ptr %x acquire, align 2 |
| %sret = sext <1 x i16> %ret to <1 x i64> |
| ret <1 x i64> %sret |
| } |
| |
| define <1 x ptr addrspace(270)> @atomic_vec1_ptr270(ptr %x) { |
| ; CHECK-LABEL: atomic_vec1_ptr270: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movl (%rdi), %eax |
| ; CHECK-NEXT: retq |
| %ret = load atomic <1 x ptr addrspace(270)>, ptr %x acquire, align 4 |
| ret <1 x ptr addrspace(270)> %ret |
| } |
| |
| define <1 x bfloat> @atomic_vec1_bfloat(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec1_bfloat: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-SSE-O3-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec1_bfloat: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-AVX-O3-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec1_bfloat: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movw (%rdi), %cx |
| ; CHECK-SSE-O0-NEXT: # implicit-def: $eax |
| ; CHECK-SSE-O0-NEXT: movw %cx, %ax |
| ; CHECK-SSE-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec1_bfloat: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: movw (%rdi), %cx |
| ; CHECK-AVX-O0-NEXT: # implicit-def: $eax |
| ; CHECK-AVX-O0-NEXT: movw %cx, %ax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <1 x bfloat>, ptr %x acquire, align 2 |
| ret <1 x bfloat> %ret |
| } |
| |
| define <1 x ptr> @atomic_vec1_ptr_align(ptr %x) nounwind { |
| ; CHECK-LABEL: atomic_vec1_ptr_align: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movq (%rdi), %rax |
| ; CHECK-NEXT: retq |
| %ret = load atomic <1 x ptr>, ptr %x acquire, align 8 |
| ret <1 x ptr> %ret |
| } |
| |
| define <1 x i64> @atomic_vec1_i64_align(ptr %x) nounwind { |
| ; CHECK-LABEL: atomic_vec1_i64_align: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movq (%rdi), %rax |
| ; CHECK-NEXT: retq |
| %ret = load atomic <1 x i64>, ptr %x acquire, align 8 |
| ret <1 x i64> %ret |
| } |
| |
| define void @store_atomic_vec1_i32(ptr %x, <1 x i32> %v) { |
| ; CHECK-LABEL: store_atomic_vec1_i32: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movl %esi, (%rdi) |
| ; CHECK-NEXT: retq |
| store atomic <1 x i32> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_i8(ptr %x, <1 x i8> %v) { |
| ; CHECK-O3-LABEL: store_atomic_vec1_i8: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: movb %sil, (%rdi) |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: store_atomic_vec1_i8: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: movb %sil, %al |
| ; CHECK-O0-NEXT: movb %al, (%rdi) |
| ; CHECK-O0-NEXT: retq |
| store atomic <1 x i8> %v, ptr %x release, align 1 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_i16(ptr %x, <1 x i16> %v) { |
| ; CHECK-O3-LABEL: store_atomic_vec1_i16: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: movw %si, (%rdi) |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: store_atomic_vec1_i16: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: movw %si, %ax |
| ; CHECK-O0-NEXT: movw %ax, (%rdi) |
| ; CHECK-O0-NEXT: retq |
| store atomic <1 x i16> %v, ptr %x release, align 2 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_i64(ptr %x, <1 x i64> %v) nounwind { |
| ; CHECK-LABEL: store_atomic_vec1_i64: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movq %rsi, (%rdi) |
| ; CHECK-NEXT: retq |
| store atomic <1 x i64> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_ptr(ptr %x, <1 x ptr> %v) nounwind { |
| ; CHECK-LABEL: store_atomic_vec1_ptr: |
| ; CHECK: # %bb.0: |
| ; CHECK-NEXT: movq %rsi, (%rdi) |
| ; CHECK-NEXT: retq |
| store atomic <1 x ptr> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_bfloat(ptr %x, <1 x bfloat> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec1_bfloat: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE-O3-NEXT: movw %ax, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec1_bfloat: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vpextrw $0, %xmm0, %eax |
| ; CHECK-AVX-O3-NEXT: movw %ax, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec1_bfloat: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: pushq %rax |
| ; CHECK-SSE-O0-NEXT: movq %rdi, (%rsp) # 8-byte Spill |
| ; CHECK-SSE-O0-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE-O0-NEXT: movw %ax, %cx |
| ; CHECK-SSE-O0-NEXT: # implicit-def: $eax |
| ; CHECK-SSE-O0-NEXT: movw %cx, %ax |
| ; CHECK-SSE-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE-O0-NEXT: movq (%rsp), %rdi # 8-byte Reload |
| ; CHECK-SSE-O0-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE-O0-NEXT: movw %ax, (%rdi) |
| ; CHECK-SSE-O0-NEXT: popq %rax |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec1_bfloat: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: pushq %rax |
| ; CHECK-AVX-O0-NEXT: movq %rdi, (%rsp) # 8-byte Spill |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: movw %ax, %cx |
| ; CHECK-AVX-O0-NEXT: # implicit-def: $eax |
| ; CHECK-AVX-O0-NEXT: movw %cx, %ax |
| ; CHECK-AVX-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX-O0-NEXT: movq (%rsp), %rdi # 8-byte Reload |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-AVX-O0-NEXT: movw %ax, (%rdi) |
| ; CHECK-AVX-O0-NEXT: popq %rax |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <1 x bfloat> %v, ptr %x release, align 2 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_half(ptr %x, <1 x half> %v) { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec1_half: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE-O3-NEXT: movw %ax, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec1_half: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vpextrw $0, %xmm0, %eax |
| ; CHECK-AVX-O3-NEXT: movw %ax, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec1_half: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE-O0-NEXT: movw %ax, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec1_half: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-AVX-O0-NEXT: movw %ax, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <1 x half> %v, ptr %x release, align 2 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_float(ptr %x, <1 x float> %v) { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec1_float: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec1_float: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec1_float: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movss %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec1_float: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovss %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <1 x float> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_double_align(ptr %x, <1 x double> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec1_double_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movsd %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec1_double_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovsd %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec1_double_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movsd %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec1_double_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovsd %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <1 x double> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec2_i8(ptr %x, <2 x i8> %v) { |
| ; CHECK-SSE2-O3-LABEL: store_atomic_vec2_i8: |
| ; CHECK-SSE2-O3: # %bb.0: |
| ; CHECK-SSE2-O3-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE2-O3-NEXT: movw %ax, (%rdi) |
| ; CHECK-SSE2-O3-NEXT: retq |
| ; |
| ; CHECK-SSE4-O3-LABEL: store_atomic_vec2_i8: |
| ; CHECK-SSE4-O3: # %bb.0: |
| ; CHECK-SSE4-O3-NEXT: pextrw $0, %xmm0, (%rdi) |
| ; CHECK-SSE4-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_i8: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vpextrw $0, %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec2_i8: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, (%rdi) |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec2_i8: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm0, (%rdi) |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_i8: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x i8> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec2_i16(ptr %x, <2 x i16> %v) { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec2_i16: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_i16: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec2_i16: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movd %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_i16: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovd %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x i16> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec2_ptr270(ptr %x, <2 x ptr addrspace(270)> %v) { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec2_ptr270: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movlps %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_ptr270: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovlps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec2_ptr270: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_ptr270: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x ptr addrspace(270)> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec2_i32_align(ptr %x, <2 x i32> %v) { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec2_i32_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movlps %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_i32_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovlps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec2_i32_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_i32_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x i32> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec2_float_align(ptr %x, <2 x float> %v) { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec2_float_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movlps %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_float_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovlps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec2_float_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_float_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x float> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec4_i8(ptr %x, <4 x i8> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec4_i8: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec4_i8: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec4_i8: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movd %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec4_i8: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovd %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <4 x i8> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec4_i16(ptr %x, <4 x i16> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec4_i16: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movlps %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec4_i16: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovlps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec4_i16: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec4_i16: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <4 x i16> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define <2 x i8> @atomic_vec2_i8(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_i8: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-SSE-O3-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_i8: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-AVX-O3-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_i8: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movw (%rdi), %cx |
| ; CHECK-SSE-O0-NEXT: # implicit-def: $eax |
| ; CHECK-SSE-O0-NEXT: movw %cx, %ax |
| ; CHECK-SSE-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_i8: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: movw (%rdi), %cx |
| ; CHECK-AVX-O0-NEXT: # implicit-def: $eax |
| ; CHECK-AVX-O0-NEXT: movw %cx, %ax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x i8>, ptr %x acquire, align 4 |
| ret <2 x i8> %ret |
| } |
| |
| define <2 x i16> @atomic_vec2_i16(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_i16: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_i16: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_i16: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movd {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_i16: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x i16>, ptr %x acquire, align 4 |
| ret <2 x i16> %ret |
| } |
| |
| define <2 x ptr addrspace(270)> @atomic_vec2_ptr270(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_ptr270: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_ptr270: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_ptr270: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_ptr270: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x ptr addrspace(270)>, ptr %x acquire, align 8 |
| ret <2 x ptr addrspace(270)> %ret |
| } |
| define <2 x ptr> @atomic_vec2_ptr_align(ptr %x) nounwind { |
| ; CHECK-SSE2-O3-LABEL: atomic_vec2_ptr_align: |
| ; CHECK-SSE2-O3: # %bb.0: |
| ; CHECK-SSE2-O3-NEXT: pushq %rax |
| ; CHECK-SSE2-O3-NEXT: movl $2, %esi |
| ; CHECK-SSE2-O3-NEXT: callq __atomic_load_16@PLT |
| ; CHECK-SSE2-O3-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE2-O3-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE2-O3-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE2-O3-NEXT: popq %rax |
| ; CHECK-SSE2-O3-NEXT: retq |
| ; |
| ; CHECK-SSE4-O3-LABEL: atomic_vec2_ptr_align: |
| ; CHECK-SSE4-O3: # %bb.0: |
| ; CHECK-SSE4-O3-NEXT: movaps (%rdi), %xmm0 |
| ; CHECK-SSE4-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_ptr_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovaps (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: atomic_vec2_ptr_align: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: pushq %rax |
| ; CHECK-SSE2-O0-NEXT: movl $2, %esi |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_load_16@PLT |
| ; CHECK-SSE2-O0-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE2-O0-NEXT: popq %rax |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: atomic_vec2_ptr_align: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: movapd (%rdi), %xmm0 |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_ptr_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovapd (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x ptr>, ptr %x acquire, align 16 |
| ret <2 x ptr> %ret |
| } |
| |
| define void @store_atomic_vec2_ptr_align(ptr %x, <2 x ptr> %v) nounwind { |
| ; CHECK-SSE2-O3-LABEL: store_atomic_vec2_ptr_align: |
| ; CHECK-SSE2-O3: # %bb.0: |
| ; CHECK-SSE2-O3-NEXT: pushq %rax |
| ; CHECK-SSE2-O3-NEXT: movq %xmm0, %rsi |
| ; CHECK-SSE2-O3-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3] |
| ; CHECK-SSE2-O3-NEXT: movq %xmm0, %rdx |
| ; CHECK-SSE2-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O3-NEXT: callq __atomic_store_16@PLT |
| ; CHECK-SSE2-O3-NEXT: popq %rax |
| ; CHECK-SSE2-O3-NEXT: retq |
| ; |
| ; CHECK-SSE4-O3-LABEL: store_atomic_vec2_ptr_align: |
| ; CHECK-SSE4-O3: # %bb.0: |
| ; CHECK-SSE4-O3-NEXT: movaps %xmm0, (%rdi) |
| ; CHECK-SSE4-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_ptr_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovaps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec2_ptr_align: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: pushq %rax |
| ; CHECK-SSE2-O0-NEXT: movq %xmm0, %rsi |
| ; CHECK-SSE2-O0-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3] |
| ; CHECK-SSE2-O0-NEXT: movq %xmm0, %rdx |
| ; CHECK-SSE2-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_store_16@PLT |
| ; CHECK-SSE2-O0-NEXT: popq %rax |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec2_ptr_align: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, (%rdi) |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_ptr_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovdqa %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x ptr> %v, ptr %x release, align 16 |
| ret void |
| } |
| |
| define <4 x ptr addrspace(270)> @atomic_vec4_ptr270(ptr %x) nounwind { |
| ; CHECK-SSE2-O3-LABEL: atomic_vec4_ptr270: |
| ; CHECK-SSE2-O3: # %bb.0: |
| ; CHECK-SSE2-O3-NEXT: pushq %rax |
| ; CHECK-SSE2-O3-NEXT: movl $2, %esi |
| ; CHECK-SSE2-O3-NEXT: callq __atomic_load_16@PLT |
| ; CHECK-SSE2-O3-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE2-O3-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE2-O3-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE2-O3-NEXT: popq %rax |
| ; CHECK-SSE2-O3-NEXT: retq |
| ; |
| ; CHECK-SSE4-O3-LABEL: atomic_vec4_ptr270: |
| ; CHECK-SSE4-O3: # %bb.0: |
| ; CHECK-SSE4-O3-NEXT: movaps (%rdi), %xmm0 |
| ; CHECK-SSE4-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec4_ptr270: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovaps (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: atomic_vec4_ptr270: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: pushq %rax |
| ; CHECK-SSE2-O0-NEXT: movl $2, %esi |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_load_16@PLT |
| ; CHECK-SSE2-O0-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE2-O0-NEXT: popq %rax |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: atomic_vec4_ptr270: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: movapd (%rdi), %xmm0 |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec4_ptr270: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovapd (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <4 x ptr addrspace(270)>, ptr %x acquire, align 16 |
| ret <4 x ptr addrspace(270)> %ret |
| } |
| |
| define void @store_atomic_vec4_ptr270_align(ptr %x, <4 x ptr addrspace(270)> %v) nounwind { |
| ; CHECK-SSE2-O3-LABEL: store_atomic_vec4_ptr270_align: |
| ; CHECK-SSE2-O3: # %bb.0: |
| ; CHECK-SSE2-O3-NEXT: pushq %rax |
| ; CHECK-SSE2-O3-NEXT: movq %xmm0, %rsi |
| ; CHECK-SSE2-O3-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3] |
| ; CHECK-SSE2-O3-NEXT: movq %xmm0, %rdx |
| ; CHECK-SSE2-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O3-NEXT: callq __atomic_store_16@PLT |
| ; CHECK-SSE2-O3-NEXT: popq %rax |
| ; CHECK-SSE2-O3-NEXT: retq |
| ; |
| ; CHECK-SSE4-O3-LABEL: store_atomic_vec4_ptr270_align: |
| ; CHECK-SSE4-O3: # %bb.0: |
| ; CHECK-SSE4-O3-NEXT: movaps %xmm0, (%rdi) |
| ; CHECK-SSE4-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec4_ptr270_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovaps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec4_ptr270_align: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: pushq %rax |
| ; CHECK-SSE2-O0-NEXT: movq %xmm0, %rsi |
| ; CHECK-SSE2-O0-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3] |
| ; CHECK-SSE2-O0-NEXT: movq %xmm0, %rdx |
| ; CHECK-SSE2-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_store_16@PLT |
| ; CHECK-SSE2-O0-NEXT: popq %rax |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec4_ptr270_align: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, (%rdi) |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec4_ptr270_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovdqa %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <4 x ptr addrspace(270)> %v, ptr %x release, align 16 |
| ret void |
| } |
| |
| define <2 x i32> @atomic_vec2_i32_align(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_i32_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_i32_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_i32_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_i32_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x i32>, ptr %x acquire, align 8 |
| ret <2 x i32> %ret |
| } |
| |
| define <2 x float> @atomic_vec2_float_align(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_float_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_float_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_float_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_float_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x float>, ptr %x acquire, align 8 |
| ret <2 x float> %ret |
| } |
| |
| define void @store_atomic_vec2_half(ptr %x, <2 x half> %v) { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec2_half: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_half: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec2_half: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE-O0-NEXT: movaps %xmm1, %xmm0 |
| ; CHECK-SSE-O0-NEXT: psrld $16, %xmm1 |
| ; CHECK-SSE-O0-NEXT: punpcklwd {{.*#+}} xmm0 = xmm0[0],xmm1[0],xmm0[1],xmm1[1],xmm0[2],xmm1[2],xmm0[3],xmm1[3] |
| ; CHECK-SSE-O0-NEXT: movd %xmm0, (%rdi) |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_half: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovd %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x half> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec2_bfloat(ptr %x, <2 x bfloat> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec2_bfloat: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_bfloat: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec2_bfloat: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: subq $24, %rsp |
| ; CHECK-SSE2-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rdi # 8-byte Reload |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: movl {{[0-9]+}}(%rsp), %eax |
| ; CHECK-SSE2-O0-NEXT: movl %eax, (%rdi) |
| ; CHECK-SSE2-O0-NEXT: addq $24, %rsp |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec2_bfloat: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: subq $24, %rsp |
| ; CHECK-SSE4-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rdi # 8-byte Reload |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: movl {{[0-9]+}}(%rsp), %eax |
| ; CHECK-SSE4-O0-NEXT: movl %eax, (%rdi) |
| ; CHECK-SSE4-O0-NEXT: addq $24, %rsp |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_bfloat: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $24, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-AVX-O0-NEXT: vpextrw $1, %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX-O0-NEXT: vmovd %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rdi # 8-byte Reload |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX-O0-NEXT: movl {{[0-9]+}}(%rsp), %eax |
| ; CHECK-AVX-O0-NEXT: movl %eax, (%rdi) |
| ; CHECK-AVX-O0-NEXT: addq $24, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x bfloat> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec4_half(ptr %x, <4 x half> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec4_half: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movlps %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec4_half: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovlps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec4_half: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm3 |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm3, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm3, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: psrlq $48, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm3, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: shufps {{.*#+}} xmm1 = xmm1[1,1,1,1] |
| ; CHECK-SSE2-O0-NEXT: psrld $16, %xmm3 |
| ; CHECK-SSE2-O0-NEXT: punpcklwd {{.*#+}} xmm0 = xmm0[0],xmm3[0],xmm0[1],xmm3[1],xmm0[2],xmm3[2],xmm0[3],xmm3[3] |
| ; CHECK-SSE2-O0-NEXT: punpcklwd {{.*#+}} xmm1 = xmm1[0],xmm2[0],xmm1[1],xmm2[1],xmm1[2],xmm2[2],xmm1[3],xmm2[3] |
| ; CHECK-SSE2-O0-NEXT: unpcklps {{.*#+}} xmm0 = xmm0[0],xmm1[0],xmm0[1],xmm1[1] |
| ; CHECK-SSE2-O0-NEXT: movq %xmm0, (%rdi) |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec4_half: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm3 |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm3, %xmm0 |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm3, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: psrlq $48, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movshdup {{.*#+}} xmm1 = xmm3[1,1,3,3] |
| ; CHECK-SSE4-O0-NEXT: psrld $16, %xmm3 |
| ; CHECK-SSE4-O0-NEXT: punpcklwd {{.*#+}} xmm0 = xmm0[0],xmm3[0],xmm0[1],xmm3[1],xmm0[2],xmm3[2],xmm0[3],xmm3[3] |
| ; CHECK-SSE4-O0-NEXT: punpcklwd {{.*#+}} xmm1 = xmm1[0],xmm2[0],xmm1[1],xmm2[1],xmm1[2],xmm2[2],xmm1[3],xmm2[3] |
| ; CHECK-SSE4-O0-NEXT: punpckldq {{.*#+}} xmm0 = xmm0[0],xmm1[0],xmm0[1],xmm1[1] |
| ; CHECK-SSE4-O0-NEXT: movq %xmm0, (%rdi) |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec4_half: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <4 x half> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec4_bfloat(ptr %x, <4 x bfloat> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec4_bfloat: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movlps %xmm0, (%rdi) |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec4_bfloat: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovlps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec4_bfloat: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: subq $40, %rsp |
| ; CHECK-SSE2-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $3, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $2, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rdi # 8-byte Reload |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: movq {{[0-9]+}}(%rsp), %rax |
| ; CHECK-SSE2-O0-NEXT: movq %rax, (%rdi) |
| ; CHECK-SSE2-O0-NEXT: addq $40, %rsp |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec4_bfloat: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: subq $40, %rsp |
| ; CHECK-SSE4-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $3, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $2, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rdi # 8-byte Reload |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: movq {{[0-9]+}}(%rsp), %rax |
| ; CHECK-SSE4-O0-NEXT: movq %rax, (%rdi) |
| ; CHECK-SSE4-O0-NEXT: addq $40, %rsp |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec4_bfloat: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-AVX-O0-NEXT: vpextrw $3, %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX-O0-NEXT: vpextrw $2, %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX-O0-NEXT: vpextrw $1, %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX-O0-NEXT: vmovd %xmm0, %eax |
| ; CHECK-AVX-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rdi # 8-byte Reload |
| ; CHECK-AVX-O0-NEXT: vpextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX-O0-NEXT: movq {{[0-9]+}}(%rsp), %rax |
| ; CHECK-AVX-O0-NEXT: movq %rax, (%rdi) |
| ; CHECK-AVX-O0-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <4 x bfloat> %v, ptr %x release, align 8 |
| ret void |
| } |
| |
| define void @store_atomic_vec4_float_align(ptr %x, <4 x float> %v) nounwind { |
| ; CHECK-SSE2-O3-LABEL: store_atomic_vec4_float_align: |
| ; CHECK-SSE2-O3: # %bb.0: |
| ; CHECK-SSE2-O3-NEXT: pushq %rax |
| ; CHECK-SSE2-O3-NEXT: movq %xmm0, %rsi |
| ; CHECK-SSE2-O3-NEXT: punpckhqdq {{.*#+}} xmm0 = xmm0[1,1] |
| ; CHECK-SSE2-O3-NEXT: movq %xmm0, %rdx |
| ; CHECK-SSE2-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O3-NEXT: callq __atomic_store_16@PLT |
| ; CHECK-SSE2-O3-NEXT: popq %rax |
| ; CHECK-SSE2-O3-NEXT: retq |
| ; |
| ; CHECK-SSE4-O3-LABEL: store_atomic_vec4_float_align: |
| ; CHECK-SSE4-O3: # %bb.0: |
| ; CHECK-SSE4-O3-NEXT: pushq %rbx |
| ; CHECK-SSE4-O3-NEXT: movdqa (%rdi), %xmm1 |
| ; CHECK-SSE4-O3-NEXT: pextrq $1, %xmm0, %rcx |
| ; CHECK-SSE4-O3-NEXT: movq %xmm0, %rbx |
| ; CHECK-SSE4-O3-NEXT: .p2align 4 |
| ; CHECK-SSE4-O3-NEXT: .LBB41_1: # %atomicrmw.start |
| ; CHECK-SSE4-O3-NEXT: # =>This Inner Loop Header: Depth=1 |
| ; CHECK-SSE4-O3-NEXT: movq %xmm1, %rax |
| ; CHECK-SSE4-O3-NEXT: pextrq $1, %xmm1, %rdx |
| ; CHECK-SSE4-O3-NEXT: lock cmpxchg16b (%rdi) |
| ; CHECK-SSE4-O3-NEXT: movq %rdx, %xmm0 |
| ; CHECK-SSE4-O3-NEXT: movq %rax, %xmm1 |
| ; CHECK-SSE4-O3-NEXT: punpcklqdq {{.*#+}} xmm1 = xmm1[0],xmm0[0] |
| ; CHECK-SSE4-O3-NEXT: jne .LBB41_1 |
| ; CHECK-SSE4-O3-NEXT: # %bb.2: # %atomicrmw.end |
| ; CHECK-SSE4-O3-NEXT: popq %rbx |
| ; CHECK-SSE4-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec4_float_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovaps %xmm0, (%rdi) |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec4_float_align: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: pushq %rax |
| ; CHECK-SSE2-O0-NEXT: movq %xmm0, %rsi |
| ; CHECK-SSE2-O0-NEXT: unpckhpd {{.*#+}} xmm0 = xmm0[1,1] |
| ; CHECK-SSE2-O0-NEXT: movq %xmm0, %rdx |
| ; CHECK-SSE2-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_store_16@PLT |
| ; CHECK-SSE2-O0-NEXT: popq %rax |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec4_float_align: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: pushq %rbx |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) # 16-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movaps (%rdi), %xmm0 |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) # 16-byte Spill |
| ; CHECK-SSE4-O0-NEXT: .LBB41_1: # %atomicrmw.start |
| ; CHECK-SSE4-O0-NEXT: # =>This Inner Loop Header: Depth=1 |
| ; CHECK-SSE4-O0-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 16-byte Reload |
| ; CHECK-SSE4-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-SSE4-O0-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 # 16-byte Reload |
| ; CHECK-SSE4-O0-NEXT: pextrq $1, %xmm1, %rcx |
| ; CHECK-SSE4-O0-NEXT: movq %xmm1, %rbx |
| ; CHECK-SSE4-O0-NEXT: movq %xmm0, %rax |
| ; CHECK-SSE4-O0-NEXT: pextrq $1, %xmm0, %rdx |
| ; CHECK-SSE4-O0-NEXT: lock cmpxchg16b (%rsi) |
| ; CHECK-SSE4-O0-NEXT: movq %rax, %rcx |
| ; CHECK-SSE4-O0-NEXT: sete %al |
| ; CHECK-SSE4-O0-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movq %rcx, %xmm0 |
| ; CHECK-SSE4-O0-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE4-O0-NEXT: testb $1, %al |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) # 16-byte Spill |
| ; CHECK-SSE4-O0-NEXT: jne .LBB41_2 |
| ; CHECK-SSE4-O0-NEXT: jmp .LBB41_1 |
| ; CHECK-SSE4-O0-NEXT: .LBB41_2: # %atomicrmw.end |
| ; CHECK-SSE4-O0-NEXT: popq %rbx |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec4_float_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovaps %xmm0, (%rdi) |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <4 x float> %v, ptr %x release, align 16 |
| ret void |
| } |
| |
| define <2 x half> @atomic_vec2_half(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_half: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_half: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_half: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movd {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_half: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x half>, ptr %x acquire, align 4 |
| ret <2 x half> %ret |
| } |
| define <2 x bfloat> @atomic_vec2_bfloat(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_bfloat: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_bfloat: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_bfloat: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movd {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_bfloat: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x bfloat>, ptr %x acquire, align 4 |
| ret <2 x bfloat> %ret |
| } |
| define <1 x ptr> @atomic_vec1_ptr(ptr %x) nounwind { |
| ; CHECK-O3-LABEL: atomic_vec1_ptr: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: pushq %rax |
| ; CHECK-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-O3-NEXT: movl $8, %edi |
| ; CHECK-O3-NEXT: movl $2, %ecx |
| ; CHECK-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-O3-NEXT: movq (%rsp), %rax |
| ; CHECK-O3-NEXT: popq %rcx |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: atomic_vec1_ptr: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: pushq %rax |
| ; CHECK-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-O0-NEXT: movl $8, %edi |
| ; CHECK-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-O0-NEXT: movl $2, %ecx |
| ; CHECK-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-O0-NEXT: movq (%rsp), %rax |
| ; CHECK-O0-NEXT: popq %rcx |
| ; CHECK-O0-NEXT: retq |
| %ret = load atomic <1 x ptr>, ptr %x acquire, align 4 |
| ret <1 x ptr> %ret |
| } |
| |
| define <1 x half> @atomic_vec1_half(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec1_half: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-SSE-O3-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec1_half: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: movzwl (%rdi), %eax |
| ; CHECK-AVX-O3-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec1_half: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movw (%rdi), %cx |
| ; CHECK-SSE-O0-NEXT: # implicit-def: $eax |
| ; CHECK-SSE-O0-NEXT: movw %cx, %ax |
| ; CHECK-SSE-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec1_half: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: movw (%rdi), %cx |
| ; CHECK-AVX-O0-NEXT: # implicit-def: $eax |
| ; CHECK-AVX-O0-NEXT: movw %cx, %ax |
| ; CHECK-AVX-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <1 x half>, ptr %x acquire, align 2 |
| ret <1 x half> %ret |
| } |
| |
| define <1 x float> @atomic_vec1_float(ptr %x) { |
| ; CHECK-SSE-O3-LABEL: atomic_vec1_float: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec1_float: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec1_float: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec1_float: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <1 x float>, ptr %x acquire, align 4 |
| ret <1 x float> %ret |
| } |
| |
| define <1 x double> @atomic_vec1_double_align(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec1_double_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec1_double_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec1_double_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec1_double_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <1 x double>, ptr %x acquire, align 8 |
| ret <1 x double> %ret |
| } |
| |
| define <1 x i64> @atomic_vec1_i64(ptr %x) nounwind { |
| ; CHECK-O3-LABEL: atomic_vec1_i64: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: pushq %rax |
| ; CHECK-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-O3-NEXT: movl $8, %edi |
| ; CHECK-O3-NEXT: movl $2, %ecx |
| ; CHECK-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-O3-NEXT: movq (%rsp), %rax |
| ; CHECK-O3-NEXT: popq %rcx |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: atomic_vec1_i64: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: pushq %rax |
| ; CHECK-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-O0-NEXT: movl $8, %edi |
| ; CHECK-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-O0-NEXT: movl $2, %ecx |
| ; CHECK-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-O0-NEXT: movq (%rsp), %rax |
| ; CHECK-O0-NEXT: popq %rcx |
| ; CHECK-O0-NEXT: retq |
| %ret = load atomic <1 x i64>, ptr %x acquire, align 4 |
| ret <1 x i64> %ret |
| } |
| |
| define <1 x double> @atomic_vec1_double(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec1_double: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: pushq %rax |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $8, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-SSE-O3-NEXT: popq %rax |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec1_double: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: pushq %rax |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $8, %edi |
| ; CHECK-AVX-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O3-NEXT: vmovsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-AVX-O3-NEXT: popq %rax |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec1_double: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: pushq %rax |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $8, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-SSE-O0-NEXT: popq %rax |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec1_double: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: pushq %rax |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: movl $8, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O0-NEXT: vmovsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-AVX-O0-NEXT: popq %rax |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <1 x double>, ptr %x acquire, align 4 |
| ret <1 x double> %ret |
| } |
| |
| define <2 x i32> @atomic_vec2_i32(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec2_i32: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: pushq %rax |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $8, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-SSE-O3-NEXT: popq %rax |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec2_i32: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: pushq %rax |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $8, %edi |
| ; CHECK-AVX-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O3-NEXT: vmovsd {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-AVX-O3-NEXT: popq %rax |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec2_i32: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: pushq %rax |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $8, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movq {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-SSE-O0-NEXT: popq %rax |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec2_i32: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: pushq %rax |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: movl $8, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O0-NEXT: vmovq {{.*#+}} xmm0 = mem[0],zero |
| ; CHECK-AVX-O0-NEXT: popq %rax |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <2 x i32>, ptr %x acquire, align 4 |
| ret <2 x i32> %ret |
| } |
| |
| define <4 x i8> @atomic_vec4_i8(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec4_i8: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec4_i8: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec4_i8: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movd {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec4_i8: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovss {{.*#+}} xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <4 x i8>, ptr %x acquire, align 4 |
| ret <4 x i8> %ret |
| } |
| |
| define <4 x i16> @atomic_vec4_i16(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec4_i16: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec4_i16: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec4_i16: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec4_i16: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <4 x i16>, ptr %x acquire, align 8 |
| ret <4 x i16> %ret |
| } |
| |
| define <4 x half> @atomic_vec4_half(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec4_half: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec4_half: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec4_half: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec4_half: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <4 x half>, ptr %x acquire, align 8 |
| ret <4 x half> %ret |
| } |
| define <4 x bfloat> @atomic_vec4_bfloat(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec4_bfloat: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec4_bfloat: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec4_bfloat: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: movq (%rdi), %xmm0 |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec4_bfloat: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovq (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <4 x bfloat>, ptr %x acquire, align 8 |
| ret <4 x bfloat> %ret |
| } |
| |
| define <4 x float> @atomic_vec4_float(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec4_float: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $24, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $16, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: addq $24, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec4_float: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $24, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $16, %edi |
| ; CHECK-AVX-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O3-NEXT: vmovaps (%rsp), %xmm0 |
| ; CHECK-AVX-O3-NEXT: addq $24, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec4_float: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $24, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $16, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: addq $24, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec4_float: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $24, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: movl $16, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O0-NEXT: vmovaps (%rsp), %xmm0 |
| ; CHECK-AVX-O0-NEXT: addq $24, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <4 x float>, ptr %x acquire, align 4 |
| ret <4 x float> %ret |
| } |
| |
| define <4 x float> @atomic_vec4_float_align(ptr %x) nounwind { |
| ; CHECK-SSE2-O3-LABEL: atomic_vec4_float_align: |
| ; CHECK-SSE2-O3: # %bb.0: |
| ; CHECK-SSE2-O3-NEXT: pushq %rax |
| ; CHECK-SSE2-O3-NEXT: movl $2, %esi |
| ; CHECK-SSE2-O3-NEXT: callq __atomic_load_16@PLT |
| ; CHECK-SSE2-O3-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE2-O3-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE2-O3-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE2-O3-NEXT: popq %rax |
| ; CHECK-SSE2-O3-NEXT: retq |
| ; |
| ; CHECK-SSE4-O3-LABEL: atomic_vec4_float_align: |
| ; CHECK-SSE4-O3: # %bb.0: |
| ; CHECK-SSE4-O3-NEXT: pushq %rbx |
| ; CHECK-SSE4-O3-NEXT: xorl %eax, %eax |
| ; CHECK-SSE4-O3-NEXT: xorl %edx, %edx |
| ; CHECK-SSE4-O3-NEXT: xorl %ecx, %ecx |
| ; CHECK-SSE4-O3-NEXT: xorl %ebx, %ebx |
| ; CHECK-SSE4-O3-NEXT: lock cmpxchg16b (%rdi) |
| ; CHECK-SSE4-O3-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE4-O3-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE4-O3-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE4-O3-NEXT: popq %rbx |
| ; CHECK-SSE4-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec4_float_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: vmovaps (%rdi), %xmm0 |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: atomic_vec4_float_align: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: pushq %rax |
| ; CHECK-SSE2-O0-NEXT: movl $2, %esi |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_load_16@PLT |
| ; CHECK-SSE2-O0-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE2-O0-NEXT: popq %rax |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: atomic_vec4_float_align: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: pushq %rbx |
| ; CHECK-SSE4-O0-NEXT: xorl %eax, %eax |
| ; CHECK-SSE4-O0-NEXT: movl %eax, %ebx |
| ; CHECK-SSE4-O0-NEXT: movq %rbx, %rax |
| ; CHECK-SSE4-O0-NEXT: movq %rbx, %rdx |
| ; CHECK-SSE4-O0-NEXT: movq %rbx, %rcx |
| ; CHECK-SSE4-O0-NEXT: lock cmpxchg16b (%rdi) |
| ; CHECK-SSE4-O0-NEXT: movq %rdx, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movq %rax, %xmm0 |
| ; CHECK-SSE4-O0-NEXT: punpcklqdq {{.*#+}} xmm0 = xmm0[0],xmm1[0] |
| ; CHECK-SSE4-O0-NEXT: popq %rbx |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec4_float_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: vmovaps (%rdi), %xmm0 |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <4 x float>, ptr %x acquire, align 16 |
| ret <4 x float> %ret |
| } |
| |
| define <8 x double> @atomic_vec8_double(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec8_double: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: atomic_vec8_double: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O3-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: atomic_vec8_double: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O3-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec8_double: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movapd (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movapd {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: movapd {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O0-NEXT: movapd {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: atomic_vec8_double: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovupd (%rsp), %ymm0 |
| ; CHECK-AVX2-O0-NEXT: vmovupd {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: atomic_vec8_double: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovupd (%rsp), %zmm0 |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| %ret = load atomic <8 x double>, ptr %x acquire, align 4 |
| ret <8 x double> %ret |
| } |
| |
| define <16 x bfloat> @atomic_vec16_bfloat(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec16_bfloat: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $32, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec16_bfloat: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $32, %edi |
| ; CHECK-AVX-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX-O3-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec16_bfloat: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec16_bfloat: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O0-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX-O0-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <16 x bfloat>, ptr %x acquire, align 4 |
| ret <16 x bfloat> %ret |
| } |
| |
| define <32 x half> @atomic_vec32_half(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec32_half: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: atomic_vec32_half: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O3-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: atomic_vec32_half: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O3-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec32_half: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: atomic_vec32_half: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O0-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: atomic_vec32_half: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| %ret = load atomic <32 x half>, ptr %x acquire, align 4 |
| ret <32 x half> %ret |
| } |
| |
| define <8 x float> @atomic_vec8_float_align(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec8_float_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $32, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec8_float_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $32, %edi |
| ; CHECK-AVX-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX-O3-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec8_float_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec8_float_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O0-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX-O0-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <8 x float>, ptr %x acquire, align 32 |
| ret <8 x float> %ret |
| } |
| |
| define <16 x float> @atomic_vec16_float_align(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec16_float_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: atomic_vec16_float_align: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O3-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: atomic_vec16_float_align: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O3-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec16_float_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: atomic_vec16_float_align: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O0-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: atomic_vec16_float_align: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| %ret = load atomic <16 x float>, ptr %x acquire, align 64 |
| ret <16 x float> %ret |
| } |
| |
| define <8 x double> @atomic_vec8_double_align(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec8_double_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: atomic_vec8_double_align: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O3-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: atomic_vec8_double_align: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O3-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec8_double_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movapd (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movapd {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: movapd {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O0-NEXT: movapd {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: atomic_vec8_double_align: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovupd (%rsp), %ymm0 |
| ; CHECK-AVX2-O0-NEXT: vmovupd {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: atomic_vec8_double_align: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovupd (%rsp), %zmm0 |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| %ret = load atomic <8 x double>, ptr %x acquire, align 64 |
| ret <8 x double> %ret |
| } |
| |
| define <16 x bfloat> @atomic_vec16_bfloat_align(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec16_bfloat_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $32, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: atomic_vec16_bfloat_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $32, %edi |
| ; CHECK-AVX-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX-O3-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec16_bfloat_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: atomic_vec16_bfloat_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX-O0-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX-O0-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| %ret = load atomic <16 x bfloat>, ptr %x acquire, align 32 |
| ret <16 x bfloat> %ret |
| } |
| |
| define <32 x half> @atomic_vec32_half_align(ptr %x) nounwind { |
| ; CHECK-SSE-O3-LABEL: atomic_vec32_half_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O3-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O3-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: atomic_vec32_half_align: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O3-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O3-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: atomic_vec32_half_align: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O3-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: atomic_vec32_half_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $2, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-SSE-O0-NEXT: movaps (%rsp), %xmm0 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm1 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm2 |
| ; CHECK-SSE-O0-NEXT: movaps {{[0-9]+}}(%rsp), %xmm3 |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: atomic_vec32_half_align: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovups (%rsp), %ymm0 |
| ; CHECK-AVX2-O0-NEXT: vmovups {{[0-9]+}}(%rsp), %ymm1 |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: atomic_vec32_half_align: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $2, %ecx |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_load@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovups (%rsp), %zmm0 |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| %ret = load atomic <32 x half>, ptr %x acquire, align 64 |
| ret <32 x half> %ret |
| } |
| |
| define void @store_atomic_vec1_ptr_unaligned(ptr %x, <1 x ptr> %v) nounwind { |
| ; CHECK-O3-LABEL: store_atomic_vec1_ptr_unaligned: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: pushq %rax |
| ; CHECK-O3-NEXT: movq %rdi, %rax |
| ; CHECK-O3-NEXT: movq %rsi, (%rsp) |
| ; CHECK-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-O3-NEXT: movl $8, %edi |
| ; CHECK-O3-NEXT: movq %rax, %rsi |
| ; CHECK-O3-NEXT: movl $3, %ecx |
| ; CHECK-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-O3-NEXT: popq %rax |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: store_atomic_vec1_ptr_unaligned: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: pushq %rax |
| ; CHECK-O0-NEXT: movq %rsi, %rax |
| ; CHECK-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-O0-NEXT: movq %rax, (%rsp) |
| ; CHECK-O0-NEXT: movl $8, %edi |
| ; CHECK-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-O0-NEXT: movl $3, %ecx |
| ; CHECK-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-O0-NEXT: popq %rax |
| ; CHECK-O0-NEXT: retq |
| store atomic <1 x ptr> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_i64_unaligned(ptr %x, <1 x i64> %v) nounwind { |
| ; CHECK-O3-LABEL: store_atomic_vec1_i64_unaligned: |
| ; CHECK-O3: # %bb.0: |
| ; CHECK-O3-NEXT: pushq %rax |
| ; CHECK-O3-NEXT: movq %rdi, %rax |
| ; CHECK-O3-NEXT: movq %rsi, (%rsp) |
| ; CHECK-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-O3-NEXT: movl $8, %edi |
| ; CHECK-O3-NEXT: movq %rax, %rsi |
| ; CHECK-O3-NEXT: movl $3, %ecx |
| ; CHECK-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-O3-NEXT: popq %rax |
| ; CHECK-O3-NEXT: retq |
| ; |
| ; CHECK-O0-LABEL: store_atomic_vec1_i64_unaligned: |
| ; CHECK-O0: # %bb.0: |
| ; CHECK-O0-NEXT: pushq %rax |
| ; CHECK-O0-NEXT: movq %rsi, %rax |
| ; CHECK-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-O0-NEXT: movq %rax, (%rsp) |
| ; CHECK-O0-NEXT: movl $8, %edi |
| ; CHECK-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-O0-NEXT: movl $3, %ecx |
| ; CHECK-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-O0-NEXT: popq %rax |
| ; CHECK-O0-NEXT: retq |
| store atomic <1 x i64> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec1_double_unaligned(ptr %x, <1 x double> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec1_double_unaligned: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: pushq %rax |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movsd %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $8, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: popq %rax |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec1_double_unaligned: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: pushq %rax |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: vmovsd %xmm0, (%rsp) |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $8, %edi |
| ; CHECK-AVX-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O3-NEXT: popq %rax |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec1_double_unaligned: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: pushq %rax |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movsd %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $8, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: popq %rax |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec1_double_unaligned: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: pushq %rax |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: vmovsd %xmm0, (%rsp) |
| ; CHECK-AVX-O0-NEXT: movl $8, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O0-NEXT: popq %rax |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <1 x double> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec2_i32_unaligned(ptr %x, <2 x i32> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec2_i32_unaligned: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: pushq %rax |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movlps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $8, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: popq %rax |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec2_i32_unaligned: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: pushq %rax |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: vmovlps %xmm0, (%rsp) |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $8, %edi |
| ; CHECK-AVX-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O3-NEXT: popq %rax |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec2_i32_unaligned: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: pushq %rax |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movq %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $8, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: popq %rax |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec2_i32_unaligned: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: pushq %rax |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: vmovq %xmm0, (%rsp) |
| ; CHECK-AVX-O0-NEXT: movl $8, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O0-NEXT: popq %rax |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <2 x i32> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec4_float_unaligned(ptr %x, <4 x float> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec4_float_unaligned: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $24, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $16, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $24, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec4_float_unaligned: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $24, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: vmovaps %xmm0, (%rsp) |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $16, %edi |
| ; CHECK-AVX-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O3-NEXT: addq $24, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec4_float_unaligned: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $24, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $16, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: addq $24, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec4_float_unaligned: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $24, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: vmovaps %xmm0, (%rsp) |
| ; CHECK-AVX-O0-NEXT: movl $16, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O0-NEXT: addq $24, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <4 x float> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec8_double_unaligned(ptr %x, <8 x double> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec8_double_unaligned: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: store_atomic_vec8_double_unaligned: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O3-NEXT: vzeroupper |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: store_atomic_vec8_double_unaligned: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O3-NEXT: vzeroupper |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec8_double_unaligned: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movapd %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movapd %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movapd %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movapd %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: store_atomic_vec8_double_unaligned: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: vmovupd %ymm0, (%rsp) |
| ; CHECK-AVX2-O0-NEXT: vmovupd %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O0-NEXT: vzeroupper |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: store_atomic_vec8_double_unaligned: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: vmovupd %zmm0, (%rsp) |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O0-NEXT: vzeroupper |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| store atomic <8 x double> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec16_bfloat_unaligned(ptr %x, <16 x bfloat> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec16_bfloat_unaligned: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $32, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec16_bfloat_unaligned: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $32, %edi |
| ; CHECK-AVX-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O3-NEXT: vzeroupper |
| ; CHECK-AVX-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O3-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec16_bfloat_unaligned: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: subq $120, %rsp |
| ; CHECK-SSE2-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $7, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $6, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $5, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $4, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $3, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $2, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $1, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: movd %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $7, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $6, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $5, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $4, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $3, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $2, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE2-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-SSE2-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE2-O0-NEXT: addq $120, %rsp |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec16_bfloat_unaligned: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: subq $120, %rsp |
| ; CHECK-SSE4-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $7, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $6, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $5, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $4, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $3, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $2, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $1, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movd %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $7, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $6, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $5, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $4, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $3, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $2, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE4-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-SSE4-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE4-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE4-O0-NEXT: addq $120, %rsp |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: store_atomic_vec16_bfloat_unaligned: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $120, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vextracti128 $1, %ymm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vpextrw $7, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $6, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $5, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $4, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $3, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $2, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $1, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vmovd %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: # kill: def $xmm0 killed $xmm0 killed $ymm0 |
| ; CHECK-AVX2-O0-NEXT: vpextrw $7, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $6, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $5, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $4, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $3, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $2, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $1, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vmovd %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX2-O0-NEXT: vzeroupper |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX2-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O0-NEXT: addq $120, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: store_atomic_vec16_bfloat_unaligned: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $120, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vextractf128 $1, %ymm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vpextrw $7, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $6, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $5, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $4, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $3, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $2, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $1, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vmovd %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: # kill: def $xmm0 killed $xmm0 killed $ymm0 |
| ; CHECK-AVX512-O0-NEXT: vpextrw $7, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $6, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $5, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $4, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $3, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $2, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $1, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vmovd %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX512-O0-NEXT: vzeroupper |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX512-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O0-NEXT: addq $120, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| store atomic <16 x bfloat> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec32_half_unaligned(ptr %x, <32 x half> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec32_half_unaligned: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: store_atomic_vec32_half_unaligned: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O3-NEXT: vzeroupper |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: store_atomic_vec32_half_unaligned: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O3-NEXT: vzeroupper |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec32_half_unaligned: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: store_atomic_vec32_half_unaligned: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O0-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O0-NEXT: vzeroupper |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: store_atomic_vec32_half_unaligned: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O0-NEXT: vzeroupper |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| store atomic <32 x half> %v, ptr %x release, align 4 |
| ret void |
| } |
| |
| define void @store_atomic_vec8_float_align(ptr %x, <8 x float> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec8_float_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $32, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec8_float_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $32, %edi |
| ; CHECK-AVX-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O3-NEXT: vzeroupper |
| ; CHECK-AVX-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O3-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec8_float_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX-O0-LABEL: store_atomic_vec8_float_align: |
| ; CHECK-AVX-O0: # %bb.0: |
| ; CHECK-AVX-O0-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O0-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O0-NEXT: vzeroupper |
| ; CHECK-AVX-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O0-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O0-NEXT: retq |
| store atomic <8 x float> %v, ptr %x release, align 32 |
| ret void |
| } |
| |
| define void @store_atomic_vec16_float_align(ptr %x, <16 x float> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec16_float_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: store_atomic_vec16_float_align: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O3-NEXT: vzeroupper |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: store_atomic_vec16_float_align: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O3-NEXT: vzeroupper |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec16_float_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: store_atomic_vec16_float_align: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O0-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O0-NEXT: vzeroupper |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: store_atomic_vec16_float_align: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O0-NEXT: vzeroupper |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| store atomic <16 x float> %v, ptr %x release, align 64 |
| ret void |
| } |
| |
| define void @store_atomic_vec8_double_align(ptr %x, <8 x double> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec8_double_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: store_atomic_vec8_double_align: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O3-NEXT: vzeroupper |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: store_atomic_vec8_double_align: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O3-NEXT: vzeroupper |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec8_double_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movapd %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movapd %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movapd %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movapd %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: store_atomic_vec8_double_align: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: vmovupd %ymm0, (%rsp) |
| ; CHECK-AVX2-O0-NEXT: vmovupd %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O0-NEXT: vzeroupper |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: store_atomic_vec8_double_align: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: vmovupd %zmm0, (%rsp) |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O0-NEXT: vzeroupper |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| store atomic <8 x double> %v, ptr %x release, align 64 |
| ret void |
| } |
| |
| define void @store_atomic_vec16_bfloat_align(ptr %x, <16 x bfloat> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec16_bfloat_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $32, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $40, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX-O3-LABEL: store_atomic_vec16_bfloat_align: |
| ; CHECK-AVX-O3: # %bb.0: |
| ; CHECK-AVX-O3-NEXT: subq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX-O3-NEXT: movl $32, %edi |
| ; CHECK-AVX-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX-O3-NEXT: vzeroupper |
| ; CHECK-AVX-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX-O3-NEXT: addq $40, %rsp |
| ; CHECK-AVX-O3-NEXT: retq |
| ; |
| ; CHECK-SSE2-O0-LABEL: store_atomic_vec16_bfloat_align: |
| ; CHECK-SSE2-O0: # %bb.0: |
| ; CHECK-SSE2-O0-NEXT: subq $120, %rsp |
| ; CHECK-SSE2-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $7, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $6, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $5, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $4, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $3, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $2, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $1, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: movd %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $7, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $6, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $5, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $4, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $3, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $2, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE2-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE2-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE2-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm1, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE2-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-SSE2-O0-NEXT: pextrw $0, %xmm0, %eax |
| ; CHECK-SSE2-O0-NEXT: # kill: def $ax killed $ax killed $eax |
| ; CHECK-SSE2-O0-NEXT: movw %ax, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE2-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE2-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-SSE2-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE2-O0-NEXT: addq $120, %rsp |
| ; CHECK-SSE2-O0-NEXT: retq |
| ; |
| ; CHECK-SSE4-O0-LABEL: store_atomic_vec16_bfloat_align: |
| ; CHECK-SSE4-O0: # %bb.0: |
| ; CHECK-SSE4-O0-NEXT: subq $120, %rsp |
| ; CHECK-SSE4-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $7, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $6, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $5, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $4, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $3, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $2, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $1, %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm2 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movd %xmm1, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $7, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $6, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $5, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $4, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $3, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $2, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: pextrw $1, %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-SSE4-O0-NEXT: movd %xmm0, %eax |
| ; CHECK-SSE4-O0-NEXT: shll $16, %eax |
| ; CHECK-SSE4-O0-NEXT: movd %eax, %xmm0 |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movaps %xmm0, %xmm1 |
| ; CHECK-SSE4-O0-NEXT: movss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-SSE4-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-SSE4-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-SSE4-O0-NEXT: pextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE4-O0-NEXT: movl $32, %edi |
| ; CHECK-SSE4-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-SSE4-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE4-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE4-O0-NEXT: addq $120, %rsp |
| ; CHECK-SSE4-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: store_atomic_vec16_bfloat_align: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $120, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vextracti128 $1, %ymm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vpextrw $7, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $6, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $5, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $4, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $3, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $2, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $1, %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vmovd %xmm1, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: # kill: def $xmm0 killed $xmm0 killed $ymm0 |
| ; CHECK-AVX2-O0-NEXT: vpextrw $7, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $6, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $5, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $4, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $3, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $2, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vpextrw $1, %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX2-O0-NEXT: vmovd %xmm0, %eax |
| ; CHECK-AVX2-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX2-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX2-O0-NEXT: vzeroupper |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX2-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX2-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX2-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-AVX2-O0-NEXT: vpextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX2-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O0-NEXT: addq $120, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: store_atomic_vec16_bfloat_align: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $120, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, {{[-0-9]+}}(%r{{[sb]}}p) # 8-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vextractf128 $1, %ymm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vpextrw $7, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $6, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $5, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $4, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $3, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $2, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $1, %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm2 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vmovd %xmm1, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: # kill: def $xmm0 killed $xmm0 killed $ymm0 |
| ; CHECK-AVX512-O0-NEXT: vpextrw $7, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $6, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $5, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $4, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $3, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $2, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vpextrw $1, %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) # 4-byte Spill |
| ; CHECK-AVX512-O0-NEXT: vmovd %xmm0, %eax |
| ; CHECK-AVX512-O0-NEXT: shll $16, %eax |
| ; CHECK-AVX512-O0-NEXT: vmovd %eax, %xmm0 |
| ; CHECK-AVX512-O0-NEXT: vzeroupper |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: vmovaps %xmm0, %xmm1 |
| ; CHECK-AVX512-O0-NEXT: vmovss {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 # 4-byte Reload |
| ; CHECK-AVX512-O0-NEXT: # xmm0 = mem[0],zero,zero,zero |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: callq __truncsfbf2@PLT |
| ; CHECK-AVX512-O0-NEXT: movq {{[-0-9]+}}(%r{{[sb]}}p), %rsi # 8-byte Reload |
| ; CHECK-AVX512-O0-NEXT: vpextrw $0, %xmm0, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX512-O0-NEXT: movl $32, %edi |
| ; CHECK-AVX512-O0-NEXT: leaq {{[0-9]+}}(%rsp), %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O0-NEXT: addq $120, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| store atomic <16 x bfloat> %v, ptr %x release, align 32 |
| ret void |
| } |
| |
| define void @store_atomic_vec32_half_align(ptr %x, <32 x half> %v) nounwind { |
| ; CHECK-SSE-O3-LABEL: store_atomic_vec32_half_align: |
| ; CHECK-SSE-O3: # %bb.0: |
| ; CHECK-SSE-O3-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O3-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O3-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O3-NEXT: movl $64, %edi |
| ; CHECK-SSE-O3-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O3-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O3-NEXT: retq |
| ; |
| ; CHECK-AVX2-O3-LABEL: store_atomic_vec32_half_align: |
| ; CHECK-AVX2-O3: # %bb.0: |
| ; CHECK-AVX2-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O3-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O3-NEXT: vzeroupper |
| ; CHECK-AVX2-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O3-NEXT: retq |
| ; |
| ; CHECK-AVX512-O3-LABEL: store_atomic_vec32_half_align: |
| ; CHECK-AVX512-O3: # %bb.0: |
| ; CHECK-AVX512-O3-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O3-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O3-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O3-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O3-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O3-NEXT: vzeroupper |
| ; CHECK-AVX512-O3-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O3-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O3-NEXT: retq |
| ; |
| ; CHECK-SSE-O0-LABEL: store_atomic_vec32_half_align: |
| ; CHECK-SSE-O0: # %bb.0: |
| ; CHECK-SSE-O0-NEXT: subq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-SSE-O0-NEXT: movaps %xmm0, (%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm1, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm2, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movaps %xmm3, {{[0-9]+}}(%rsp) |
| ; CHECK-SSE-O0-NEXT: movl $64, %edi |
| ; CHECK-SSE-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-SSE-O0-NEXT: movl $3, %ecx |
| ; CHECK-SSE-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-SSE-O0-NEXT: addq $72, %rsp |
| ; CHECK-SSE-O0-NEXT: retq |
| ; |
| ; CHECK-AVX2-O0-LABEL: store_atomic_vec32_half_align: |
| ; CHECK-AVX2-O0: # %bb.0: |
| ; CHECK-AVX2-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX2-O0-NEXT: vmovups %ymm0, (%rsp) |
| ; CHECK-AVX2-O0-NEXT: vmovups %ymm1, {{[0-9]+}}(%rsp) |
| ; CHECK-AVX2-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX2-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX2-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX2-O0-NEXT: vzeroupper |
| ; CHECK-AVX2-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX2-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX2-O0-NEXT: retq |
| ; |
| ; CHECK-AVX512-O0-LABEL: store_atomic_vec32_half_align: |
| ; CHECK-AVX512-O0: # %bb.0: |
| ; CHECK-AVX512-O0-NEXT: subq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: movq %rdi, %rsi |
| ; CHECK-AVX512-O0-NEXT: vmovups %zmm0, (%rsp) |
| ; CHECK-AVX512-O0-NEXT: movl $64, %edi |
| ; CHECK-AVX512-O0-NEXT: movq %rsp, %rdx |
| ; CHECK-AVX512-O0-NEXT: movl $3, %ecx |
| ; CHECK-AVX512-O0-NEXT: vzeroupper |
| ; CHECK-AVX512-O0-NEXT: callq __atomic_store@PLT |
| ; CHECK-AVX512-O0-NEXT: addq $72, %rsp |
| ; CHECK-AVX512-O0-NEXT: retq |
| store atomic <32 x half> %v, ptr %x release, align 64 |
| ret void |
| } |