Run DCE after a LoopFlatten test to reduce spurious output [nfc]
[llvm-project.git] / llvm / test / CodeGen / AArch64 / sve2p1-intrinsics-unpk.ll
blob8334bbe0cff3055bcee4706011e341e1a6561030
1 ; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py
2 ; RUN: llc -mtriple=aarch64-linux-gnu -mattr=+sme2 -verify-machineinstrs < %s | FileCheck %s
5 ; == 2 vectors ==
7 define { <vscale x 8 x i16>, <vscale x 8 x i16> } @test_unpk_s16_x2(<vscale x 16 x i8> %unused, <vscale x 16 x i8> %a) {
8 ; CHECK-LABEL: test_unpk_s16_x2:
9 ; CHECK:       // %bb.0:
10 ; CHECK-NEXT:    sunpk { z0.h, z1.h }, z1.b
11 ; CHECK-NEXT:    ret
12   %res = call { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.sunpk.x2.nxv8i16(<vscale x 16 x i8> %a)
13   ret { <vscale x 8 x i16>, <vscale x 8 x i16> } %res
16 define { <vscale x 4 x i32>, <vscale x 4 x i32> } @test_unpk_s32_x2(<vscale x 8 x i16> %unused, <vscale x 8 x i16> %a) {
17 ; CHECK-LABEL: test_unpk_s32_x2:
18 ; CHECK:       // %bb.0:
19 ; CHECK-NEXT:    sunpk { z0.s, z1.s }, z1.h
20 ; CHECK-NEXT:    ret
21   %res = call { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.sunpk.x2.nxv4i32(<vscale x 8 x i16> %a)
22   ret { <vscale x 4 x i32>, <vscale x 4 x i32> } %res
25 define { <vscale x 2 x i64>, <vscale x 2 x i64> } @test_unpk_s64_x2(<vscale x 4 x i32> %unusued, <vscale x 4 x i32> %a) {
26 ; CHECK-LABEL: test_unpk_s64_x2:
27 ; CHECK:       // %bb.0:
28 ; CHECK-NEXT:    sunpk { z0.d, z1.d }, z1.s
29 ; CHECK-NEXT:    ret
30   %res = call { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.sunpk.x2.nxv2i64(<vscale x 4 x i32> %a)
31   ret { <vscale x 2 x i64>, <vscale x 2 x i64> } %res
34 define { <vscale x 8 x i16>, <vscale x 8 x i16> } @test_unpk_u16_x2(<vscale x 16 x i8> %unused, <vscale x 16 x i8> %a) {
35 ; CHECK-LABEL: test_unpk_u16_x2:
36 ; CHECK:       // %bb.0:
37 ; CHECK-NEXT:    uunpk { z0.h, z1.h }, z1.b
38 ; CHECK-NEXT:    ret
39   %res = call { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.uunpk.x2.nxv8i16(<vscale x 16 x i8> %a)
40   ret { <vscale x 8 x i16>, <vscale x 8 x i16> } %res
43 define { <vscale x 4 x i32>, <vscale x 4 x i32> } @test_unpk_u32_x2(<vscale x 8 x i16> %unused, <vscale x 8 x i16> %a) {
44 ; CHECK-LABEL: test_unpk_u32_x2:
45 ; CHECK:       // %bb.0:
46 ; CHECK-NEXT:    uunpk { z0.s, z1.s }, z1.h
47 ; CHECK-NEXT:    ret
48   %res = call { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.uunpk.x2.nxv4i32(<vscale x 8 x i16> %a)
49   ret { <vscale x 4 x i32>, <vscale x 4 x i32> } %res
52 define { <vscale x 2 x i64>, <vscale x 2 x i64> } @test_unpk_u64_x2(<vscale x 4 x i32> %unused, <vscale x 4 x i32> %a) {
53 ; CHECK-LABEL: test_unpk_u64_x2:
54 ; CHECK:       // %bb.0:
55 ; CHECK-NEXT:    uunpk { z0.d, z1.d }, z1.s
56 ; CHECK-NEXT:    ret
57   %res = call { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.uunpk.x2.nxv2i64(<vscale x 4 x i32> %a)
58   ret { <vscale x 2 x i64>, <vscale x 2 x i64> } %res
62 ; == 4 vectors ==
64 define { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } @test_unpk_s16_x4(<vscale x 16 x i8> %unused, <vscale x 16 x i8> %a, <vscale x 16 x i8> %b) {
65 ; CHECK-LABEL: test_unpk_s16_x4:
66 ; CHECK:       // %bb.0:
67 ; CHECK-NEXT:    mov z3.d, z2.d
68 ; CHECK-NEXT:    mov z2.d, z1.d
69 ; CHECK-NEXT:    sunpk { z0.h - z3.h }, { z2.b, z3.b }
70 ; CHECK-NEXT:    ret
71   %res = call { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.sunpk.x4.nxv8i16(<vscale x 16 x i8> %a, <vscale x 16 x i8> %b)
72   ret { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } %res
75 define { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } @test_unpk_s32(<vscale x 8 x i16> %unused, <vscale x 8 x i16> %a, <vscale x 8 x i16> %b) {
76 ; CHECK-LABEL: test_unpk_s32:
77 ; CHECK:       // %bb.0:
78 ; CHECK-NEXT:    mov z3.d, z2.d
79 ; CHECK-NEXT:    mov z2.d, z1.d
80 ; CHECK-NEXT:    sunpk { z0.s - z3.s }, { z2.h, z3.h }
81 ; CHECK-NEXT:    ret
82   %res = call { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.sunpk.x4.nxv4i32(<vscale x 8 x i16> %a, <vscale x 8 x i16> %b)
83   ret { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } %res
86 define { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } @test_unpk_s64(<vscale x 4 x i32> %unused, <vscale x 4 x i32> %a, <vscale x 4 x i32> %b) {
87 ; CHECK-LABEL: test_unpk_s64:
88 ; CHECK:       // %bb.0:
89 ; CHECK-NEXT:    mov z3.d, z2.d
90 ; CHECK-NEXT:    mov z2.d, z1.d
91 ; CHECK-NEXT:    sunpk { z0.d - z3.d }, { z2.s, z3.s }
92 ; CHECK-NEXT:    ret
93   %res = call { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.sunpk.x4.nxv2i64(<vscale x 4 x i32> %a, <vscale x 4 x i32> %b)
94   ret { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } %res
97 define { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } @test_unpk_u16_x4(<vscale x 16 x i8> %unused, <vscale x 16 x i8> %a, <vscale x 16 x i8> %b) {
98 ; CHECK-LABEL: test_unpk_u16_x4:
99 ; CHECK:       // %bb.0:
100 ; CHECK-NEXT:    mov z3.d, z2.d
101 ; CHECK-NEXT:    mov z2.d, z1.d
102 ; CHECK-NEXT:    uunpk { z0.h - z3.h }, { z2.b, z3.b }
103 ; CHECK-NEXT:    ret
104   %res = call { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.uunpk.x4.nxv8i16(<vscale x 16 x i8> %a, <vscale x 16 x i8> %b)
105   ret { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } %res
108 define { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } @test_unpk_u32(<vscale x 8 x i16> %unused, <vscale x 8 x i16> %a, <vscale x 8 x i16> %b) {
109 ; CHECK-LABEL: test_unpk_u32:
110 ; CHECK:       // %bb.0:
111 ; CHECK-NEXT:    mov z3.d, z2.d
112 ; CHECK-NEXT:    mov z2.d, z1.d
113 ; CHECK-NEXT:    uunpk { z0.s - z3.s }, { z2.h, z3.h }
114 ; CHECK-NEXT:    ret
115   %res = call { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.uunpk.x4.nxv4i32(<vscale x 8 x i16> %a, <vscale x 8 x i16> %b)
116   ret { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } %res
119 define { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } @test_unpk_u64(<vscale x 4 x i32> %unused, <vscale x 4 x i32> %a, <vscale x 4 x i32> %b) {
120 ; CHECK-LABEL: test_unpk_u64:
121 ; CHECK:       // %bb.0:
122 ; CHECK-NEXT:    mov z3.d, z2.d
123 ; CHECK-NEXT:    mov z2.d, z1.d
124 ; CHECK-NEXT:    uunpk { z0.d - z3.d }, { z2.s, z3.s }
125 ; CHECK-NEXT:    ret
126   %res = call { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.uunpk.x4.nxv2i64(<vscale x 4 x i32> %a, <vscale x 4 x i32> %b)
127   ret { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } %res
132 ; == 2 vectors ==
133 declare { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.sunpk.x2.nxv8i16(<vscale x 16 x i8>)
134 declare { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.sunpk.x2.nxv4i32(<vscale x 8 x i16>)
135 declare { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.sunpk.x2.nxv2i64(<vscale x 4 x i32>)
136 declare { <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.uunpk.x2.nxv8i16(<vscale x 16 x i8>)
137 declare { <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.uunpk.x2.nxv4i32(<vscale x 8 x i16>)
138 declare { <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.uunpk.x2.nxv2i64(<vscale x 4 x i32>)
140 ; == 4 vectors ==
141 declare { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.sunpk.x4.nxv8i16(<vscale x 16 x i8>, <vscale x 16 x i8>)
142 declare { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.sunpk.x4.nxv4i32(<vscale x 8 x i16>, <vscale x 8 x i16>)
143 declare { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.sunpk.x4.nxv2i64(<vscale x 4 x i32>, <vscale x 4 x i32>)
144 declare { <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16>, <vscale x 8 x i16> } @llvm.aarch64.sve.uunpk.x4.nxv8i16(<vscale x 16 x i8>, <vscale x 16 x i8>)
145 declare { <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32>, <vscale x 4 x i32> } @llvm.aarch64.sve.uunpk.x4.nxv4i32(<vscale x 8 x i16>, <vscale x 8 x i16>)
146 declare { <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64>, <vscale x 2 x i64> } @llvm.aarch64.sve.uunpk.x4.nxv2i64(<vscale x 4 x i32>, <vscale x 4 x i32>)