50#include "math_kernel.cl.h"
57 b,
a, 0, 0, (*n) *
sizeof(
real),
81 const int nb = ((*m) + 256 - 1) / 256;
111 const int nb = ((*m) + 256 - 1) / 256;
142 const int nb = ((*n) + 256 - 1) / 256;
164 "masked_gather_copy_aligned_kernel", &
err);
173 const int nb = ((*n) + 256 - 1) / 256;
188 int *n1,
int *n2,
int *lx,
int *ly,
197 "face_masked_gather_copy_kernel", &
err);
211 const int nb = ((*m) + 256 - 1) / 256;
242 const int nb = ((*n) + 256 - 1) / 256;
273 const int nb = ((*n) + 256 - 1) / 256;
303 const int nb = ((*mask_size) + 256 - 1) / 256;
353 const int nb = ((*n) + 256 - 1) / 256;
381 const int nb = ((*n) + 256 - 1) / 256;
407 const int nb = ((*n) + 256 - 1) / 256;
435 const int nb = ((*n) + 256 - 1) / 256;
461 const int nb = ((*n) + 256 - 1) / 256;
489 const int nb = ((*n) + 256 - 1) / 256;
517 const int nb = ((*n) + 256 - 1) / 256;
542 const int nb = ((*n) + 256 - 1) / 256;
570 const int nb = ((*n) + 256 - 1) / 256;
596 const int nb = ((*n) + 256 - 1) / 256;
623 const int nb = ((*n) + 256 - 1) / 256;
652 const int nb = ((*n) + 256 - 1) / 256;
682 const int nb = ((*n) + 256 - 1) / 256;
712 const int nb = ((*n) + 256 - 1) / 256;
742 const int nb = ((*n) + 256 - 1) / 256;
774 const int nb = ((*n) + 256 - 1) / 256;
805 const int nb = ((*n) + 256 - 1) / 256;
836 const int nb = ((*n) + 256 - 1) / 256;
869 const int nb = ((*n) + 256 - 1) / 256;
905 const int nb = ((*n) + 256 - 1) / 256;
931 const int nb = ((*n) + 256 - 1) / 256;
958 const int nb = ((*n) + 256 - 1) / 256;
987 const int nb = ((*n) + 256 - 1) / 256;
1014 const int nb = ((*n) + 256 - 1) / 256;
1043 const int nb = ((*n) + 256 - 1) / 256;
1072 const int nb = ((*n) + 256 - 1) / 256;
1099 const int nb = ((*n) + 256 - 1) / 256;
1128 const int nb = ((*n) + 256 - 1) / 256;
1157 const int nb = ((*n) + 256 - 1) / 256;
1187 const int nb = ((*n) + 256 - 1) / 256;
1217 const int nb = ((*n) + 256 - 1) / 256;
1233 void *v1,
void *v2,
void *v3,
int *n,
1252 const int nb = ((*n) + 256 - 1) / 256;
1268 void *v1,
void *v2,
void *v3,
1269 void *w1,
void *w2,
void *
w3,
1291 const int nb = ((*n) + 256 - 1) / 256;
1325 const int nb = ((*n) + 256 - 1) / 256;
1349 for (
i = 0;
i <
nb;
i++) {
1370 for (
k = 0;
k < (*j);
k++) {
1384 const int nt = 256 /
pow2;
1385 const int nb = ((*n) + nt - 1) / nt;
1409 for (
k = 0;
k < (*j);
k++) {
1413 for (
i = 0;
i <
nb;
i++) {
1414 for (
k = 0;
k < (*j);
k++) {
1439 const int nb = ((*n) + 256 - 1) / 256;
1462 for (
i = 0;
i <
nb;
i++) {
1488 const int nb = ((*n) + 256 - 1) / 256;
1511 for (
i = 0;
i <
nb;
i++) {
1537 const int nb = ((*n) + 256 - 1) / 256;
1558 for (
i = 0;
i <
nb;
i++) {
1580 const int nb = ((*n) + 256 - 1) / 256;
1605 for (
i = 1;
i <
nb;
i++) {
1629 const int nb = ((*n) + 256 - 1) / 256;
1654 for (
i = 1;
i <
nb;
i++) {
1682 const int nb = ((*n) + 256 - 1) / 256;
1708 const int nb = ((*n) + 256 - 1) / 256;
1735 const int nb = ((*n) + 256 - 1) / 256;
1764 const int nb = ((*n) + 256 - 1) / 256;
1791 const int nb = ((*n) + 256 - 1) / 256;
1820 const int nb = ((*n) + 256 - 1) / 256;
1847 const int nb = ((*n) + 256 - 1) / 256;
1876 const int nb = ((*n) + 256 - 1) / 256;
1903 const int nb = ((*n) + 256 - 1) / 256;
1932 const int nb = ((*n) + 256 - 1) / 256;
void opencl_buffer_reserve(opencl_buffer_t *buf, size_t size)
__global__ void ale_add_kinematics_kernel(const int n, T *__restrict__ wx, T *__restrict__ wy, T *__restrict__ wz, const T *__restrict__ x_ref, const T *__restrict__ y_ref, const T *__restrict__ z_ref, const T *__restrict__ phi, const T *__restrict__ x, const T *__restrict__ y, const T *__restrict__ z, const kinematics_params_t kin_params)
__global__ void T *__restrict__ T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ w
__global__ void T *__restrict__ T *__restrict__ const T *__restrict__ const T *__restrict__ v
__global__ void const T *__restrict__ x
__global__ void const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ const T *__restrict__ w3
void opencl_kernel_jit(const char *kernel, cl_program *program)
void opencl_iadd(void *a, int *c, int *n, cl_command_queue cmd_queue)
void opencl_col3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
void opencl_cdiv(void *a, real *c, int *n, cl_command_queue cmd_queue)
void opencl_masked_scatter_copy(void *a, void *b, void *mask, int *n, int *m, cl_command_queue cmd_queue)
void opencl_pwmax_sca2(void *a, real *c, int *n, cl_command_queue cmd_queue)
void opencl_vcross(void *u1, void *u2, void *u3, void *v1, void *v2, void *v3, void *w1, void *w2, void *w3, int *n, cl_command_queue cmd_queue)
void opencl_masked_gather_copy(void *a, void *b, void *mask, int *n, int *m, cl_command_queue cmd_queue)
void opencl_sub2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_face_masked_gather_copy(void *a, void *b, void *mask, void *facet, int *n1, int *n2, int *lx, int *ly, int *lz, int *m, cl_command_queue cmd_queue)
void opencl_power(void *ap, void *a, real *p, int *n, cl_command_queue cmd_queue)
void opencl_col2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_add2s2_many(void *x, void *p, void *alpha, int *j, int *n, cl_command_queue cmd_queue)
void opencl_sub3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
void opencl_add2s1(void *a, void *b, real *c1, int *n, cl_command_queue cmd_queue)
void opencl_addcol3s2(void *a, void *b, void *c, real *s, int *n, cl_command_queue cmd_queue)
void opencl_invcol1(void *a, int *n, cl_command_queue cmd_queue)
void opencl_add3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
void opencl_rone(void *a, int *n, cl_command_queue cmd_queue)
void opencl_invcol3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
void opencl_add5s4(void *a, void *b, void *c, void *d, void *e, real *c1, real *c2, real *c3, real *c4, int *n, cl_command_queue cmd_queue)
void opencl_add4s3(void *a, void *b, void *c, void *d, real *c1, real *c2, real *c3, int *n, cl_command_queue cmd_queue)
void opencl_cmult(void *a, real *c, int *n, cl_command_queue cmd_queue)
void opencl_cfill_mask(void *a, void *c, int *size, void *mask, int *mask_size, cl_command_queue cmd_queue)
void opencl_cadd2(void *a, void *b, real *c, int *n, cl_command_queue cmd_queue)
void opencl_masked_scatter_copy_aligned(void *a, void *b, void *mask, int *n, int *m, cl_command_queue cmd_queue)
void opencl_pwmin_sca3(void *a, void *b, real *c, int *n, cl_command_queue cmd_queue)
void opencl_pwmax_vec3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
opencl_buffer_t redbuf_xp
real_xp opencl_glsc3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
void opencl_add4(void *a, void *b, void *c, void *d, int *n, cl_command_queue cmd_queue)
real_xp opencl_glsubnorm2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_pwmin_vec3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
void opencl_radd(void *a, real *c, int *n, cl_command_queue cmd_queue)
void opencl_add2s2(void *a, void *b, real *c1, int *n, cl_command_queue cmd_queue)
void opencl_vdot3(void *dot, void *u1, void *u2, void *u3, void *v1, void *v2, void *v3, int *n, cl_command_queue cmd_queue)
void opencl_pwmin_vec2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_add3s2(void *a, void *b, void *c, real *c1, real *c2, int *n, cl_command_queue cmd_queue)
void opencl_masked_copy_aligned(void *a, void *b, void *mask, int *n, int *m, cl_command_queue cmd_queue)
void opencl_addsqr2s2(void *a, void *b, real *c1, int *n, cl_command_queue cmd_queue)
void opencl_absval(void *a, int *n, cl_command_queue cmd_queue)
void opencl_cwrap(void *a, real *min_val, real *max_val, int *n, cl_command_queue cmd_queue)
real_xp opencl_glsc2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_addcol3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
real opencl_glmin(void *a, int *n, cl_command_queue cmd_queue)
void opencl_pwmax_vec2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_sqrt_inplace(void *a, int *n, cl_command_queue cmd_queue)
void opencl_rzero(void *a, int *n, cl_command_queue cmd_queue)
void opencl_copy(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_subcol3(void *a, void *b, void *c, int *n, cl_command_queue cmd_queue)
void opencl_add2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_addcol4(void *a, void *b, void *c, void *d, int *n, cl_command_queue cmd_queue)
void opencl_pwmin_sca2(void *a, real *c, int *n, cl_command_queue cmd_queue)
void opencl_pwmax_sca3(void *a, void *b, real *c, int *n, cl_command_queue cmd_queue)
void opencl_invcol2(void *a, void *b, int *n, cl_command_queue cmd_queue)
void opencl_glsc3_many(real_xp *h, void *w, void *v, void *mult, int *j, int *n, cl_command_queue cmd_queue)
void opencl_cdiv2(void *a, void *b, real *c, int *n, cl_command_queue cmd_queue)
void opencl_masked_copy_0(void *a, void *b, void *mask, int *n, int *m, cl_command_queue cmd_queue)
void opencl_cfill(void *a, real *c, int *n, cl_command_queue cmd_queue)
real_xp opencl_glsum(void *a, int *n, cl_command_queue cmd_queue)
void opencl_masked_gather_copy_aligned(void *a, void *b, void *mask, int *n, int *m, cl_command_queue cmd_queue)
real opencl_glmax(void *a, int *n, cl_command_queue cmd_queue)
void opencl_cmult2(void *a, void *b, real *c, int *n, cl_command_queue cmd_queue)
Object for handling masks in Neko.
#define OPENCL_BUFFER_INIT