49 void *
cr,
void *
cs,
void *
ct,
50 void *
dx,
void *
dy,
void *
dz,
59 void *
cr,
void *
cs,
void *
ct,
60 void *
dx,
void *
dy,
void *
dz,
74#define CASE_1D(LX, C) \
75 convect_scalar_kernel_1d<real, LX, NEKO_CHUNKS(LX, C)> \
76 <<<nblcks, NEKO_CHUNKS_NTHRDS(LX, C), 0, stream>>> \
77 ((real *) du, (real *) u, \
78 (real *) cr, (real *) cs, (real *) ct, \
79 (real *) dx, (real *) dy, (real *) dz); \
80 CUDA_CHECK(cudaGetLastError());
83#define CASE_1D_SEL(LX, SEL) \
85 case 0: CASE_1D(LX, 0); break; \
86 case 1: CASE_1D(LX, 1); break; \
87 case 2: CASE_1D(LX, 2); break; \
88 default: CASE_1D(LX, 3); break; \
91#define CASE_KSTEP(LX, C) \
92 convect_scalar_kernel_kstep<real, LX, NEKO_EB(LX, C)> \
93 <<<NEKO_EB_NBLCKS(*nel, LX, C), NEKO_EB_NTHRDS(LX, C), 0, stream>>> \
94 ((real *) du, (real *) u, \
95 (real *) cr, (real *) cs, (real *) ct, \
96 (real *) dx, (real *) dy, (real *) dz, *nel); \
97 CUDA_CHECK(cudaGetLastError());
100#define CASE_KSTEP_SEL(LX, SEL) \
102 case 0: CASE_KSTEP(LX, 0); break; \
103 case 1: CASE_KSTEP(LX, 1); break; \
104 default: CASE_KSTEP(LX, 2); break; \
109 if(autotune[LX] == 0 ) { \
110 autotune[LX]=tune_convect_scalar<LX>(du, u, \
113 nel, lx, &autotune_eb[LX], \
115 } else if (autotune[LX] == 1 ) { \
116 CASE_1D_SEL(LX, autotune_ch[LX]); \
117 } else if (autotune[LX] == 2 ) { \
118 CASE_KSTEP_SEL(LX, autotune_eb[LX]); \
122#define CASE_LARGE(LX) \
164template < const
int LX >
166 void *
cr,
void *
cs,
void *
ct,
167 void *
dx,
void *
dy,
void *
dz,
243 for (
int r = 0; r <
rounds; r++) {
__global__ void ale_add_kinematics_kernel(const int n, T *__restrict__ wx, T *__restrict__ wy, T *__restrict__ wz, const T *__restrict__ x_ref, const T *__restrict__ y_ref, const T *__restrict__ z_ref, const T *__restrict__ phi, const T *__restrict__ x, const T *__restrict__ y, const T *__restrict__ z, const kinematics_params_t kin_params)
__global__ void T *__restrict__ T *__restrict__ const T *__restrict__ u
__global__ void T *__restrict__ T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ dx
__global__ void T *__restrict__ T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ dz
__global__ void T *__restrict__ T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ dy
__global__ void const T *__restrict__ const T *__restrict__ cr
__global__ void const T *__restrict__ const T *__restrict__ const T *__restrict__ cs
__global__ void const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ ct
#define NEKO_CHUNKS_CANDIDATES
#define NEKO_EB_CANDIDATES
#define NEKO_EB_SEL(LX, SEL)
#define NEKO_CHUNKS_SEL(LX, SEL)
#define NEKO_TUNE_TIME(T, LAUNCH, LX, C, ITERS)
static int neko_tune_rounds()
#define NEKO_TUNE_LOG(LX, T1, T2)
#define NEKO_TUNE_BEST(T, BEST, N)
static int neko_tune_iters()
static int neko_chunks_env()
static int neko_eb_sweep()
void log_error(char *msg)
void log_message(char *msg)
void log_section(char *msg)
#define CASE_KSTEP_SEL(LX, SEL)
#define CASE_1D_SEL(LX, SEL)
#define CASE_KSTEP(LX, C)
void cuda_convect_scalar(void *du, void *u, void *cr, void *cs, void *ct, void *dx, void *dy, void *dz, int *nel, int *lx)
int tune_convect_scalar(void *du, void *u, void *cr, void *cs, void *ct, void *dx, void *dy, void *dz, int *nel, int *lx, int *eb_sel, int *ch_sel)