Run DCE after a LoopFlatten test to reduce spurious output [nfc]
[llvm-project.git] / llvm / test / CodeGen / NVPTX / local-stack-frame.ll
blobd702ede61addf432ec9123eff94a6477cc53be48
1 ; RUN: llc < %s -march=nvptx -mcpu=sm_20 -verify-machineinstrs | FileCheck %s --check-prefix=PTX32
2 ; RUN: llc < %s -march=nvptx64 -mcpu=sm_20 -verify-machineinstrs | FileCheck %s --check-prefix=PTX64
3 ; RUN: %if ptxas && !ptxas-12.0 %{ llc < %s -march=nvptx -mcpu=sm_20 -verify-machineinstrs | %ptxas-verify %}
4 ; RUN: %if ptxas %{ llc < %s -march=nvptx64 -mcpu=sm_20 -verify-machineinstrs | %ptxas-verify %}
6 ; Ensure we access the local stack properly
8 ; PTX32:        mov.u32          %SPL, __local_depot{{[0-9]+}};
9 ; PTX32:        cvta.local.u32   %SP, %SPL;
10 ; PTX32:        ld.param.u32     %r{{[0-9]+}}, [foo_param_0];
11 ; PTX32:        st.volatile.u32  [%SP+0], %r{{[0-9]+}};
12 ; PTX64:        mov.u64          %SPL, __local_depot{{[0-9]+}};
13 ; PTX64:        cvta.local.u64   %SP, %SPL;
14 ; PTX64:        ld.param.u32     %r{{[0-9]+}}, [foo_param_0];
15 ; PTX64:        st.volatile.u32  [%SP+0], %r{{[0-9]+}};
16 define void @foo(i32 %a) {
17   %local = alloca i32, align 4
18   store volatile i32 %a, ptr %local
19   ret void
22 ; PTX32:        mov.u32          %SPL, __local_depot{{[0-9]+}};
23 ; PTX32:        cvta.local.u32   %SP, %SPL;
24 ; PTX32:        ld.param.u32     %r{{[0-9]+}}, [foo2_param_0];
25 ; PTX32:        add.u32          %r[[SP_REG:[0-9]+]], %SPL, 0;
26 ; PTX32:        st.local.u32  [%r[[SP_REG]]], %r{{[0-9]+}};
27 ; PTX64:        mov.u64          %SPL, __local_depot{{[0-9]+}};
28 ; PTX64:        cvta.local.u64   %SP, %SPL;
29 ; PTX64:        ld.param.u32     %r{{[0-9]+}}, [foo2_param_0];
30 ; PTX64:        add.u64          %rd[[SP_REG:[0-9]+]], %SPL, 0;
31 ; PTX64:        st.local.u32  [%rd[[SP_REG]]], %r{{[0-9]+}};
32 define void @foo2(i32 %a) {
33   %local = alloca i32, align 4
34   store i32 %a, ptr %local
35   call void @bar(ptr %local)
36   ret void
39 declare void @bar(ptr %a)
41 !nvvm.annotations = !{!0}
42 !0 = !{ptr @foo2, !"kernel", i32 1}
44 ; PTX32:        mov.u32          %SPL, __local_depot{{[0-9]+}};
45 ; PTX32-NOT:    cvta.local.u32   %SP, %SPL;
46 ; PTX32:        ld.param.u32     %r{{[0-9]+}}, [foo3_param_0];
47 ; PTX32:        add.u32          %r{{[0-9]+}}, %SPL, 0;
48 ; PTX32:        st.local.u32  [%r{{[0-9]+}}], %r{{[0-9]+}};
49 ; PTX64:        mov.u64          %SPL, __local_depot{{[0-9]+}};
50 ; PTX64-NOT:    cvta.local.u64   %SP, %SPL;
51 ; PTX64:        ld.param.u32     %r{{[0-9]+}}, [foo3_param_0];
52 ; PTX64:        add.u64          %rd{{[0-9]+}}, %SPL, 0;
53 ; PTX64:        st.local.u32  [%rd{{[0-9]+}}], %r{{[0-9]+}};
54 define void @foo3(i32 %a) {
55   %local = alloca [3 x i32], align 4
56   %1 = getelementptr inbounds i32, ptr %local, i32 %a
57   store i32 %a, ptr %1
58   ret void
61 ; PTX32:        cvta.local.u32   %SP, %SPL;
62 ; PTX32:        add.u32          {{%r[0-9]+}}, %SP, 0;
63 ; PTX32:        add.u32          {{%r[0-9]+}}, %SPL, 0;
64 ; PTX32:        add.u32          {{%r[0-9]+}}, %SP, 4;
65 ; PTX32:        add.u32          {{%r[0-9]+}}, %SPL, 4;
66 ; PTX32:        st.local.u32     [{{%r[0-9]+}}], {{%r[0-9]+}}
67 ; PTX32:        st.local.u32     [{{%r[0-9]+}}], {{%r[0-9]+}}
68 ; PTX64:        cvta.local.u64   %SP, %SPL;
69 ; PTX64:        add.u64          {{%rd[0-9]+}}, %SP, 0;
70 ; PTX64:        add.u64          {{%rd[0-9]+}}, %SPL, 0;
71 ; PTX64:        add.u64          {{%rd[0-9]+}}, %SP, 4;
72 ; PTX64:        add.u64          {{%rd[0-9]+}}, %SPL, 4;
73 ; PTX64:        st.local.u32     [{{%rd[0-9]+}}], {{%r[0-9]+}}
74 ; PTX64:        st.local.u32     [{{%rd[0-9]+}}], {{%r[0-9]+}}
75 define void @foo4() {
76   %A = alloca i32
77   %B = alloca i32
78   store i32 0, ptr %A
79   store i32 0, ptr %B
80   call void @bar(ptr %A)
81   call void @bar(ptr %B)
82   ret void