blob: c6efc43e988f53083634b82e7c4b09fdab8b9242 [file] [edit]
#version 450 core
#extension GL_KHR_memory_scope_semantics : enable
#extension GL_KHR_cooperative_matrix : enable
#extension GL_EXT_shader_explicit_arithmetic_types : enable
#extension GL_EXT_cooperative_matrix_maintenance1 : enable
#extension GL_EXT_float_e5m2 : enable
layout (local_size_x = 64, local_size_y = 1, local_size_z = 1) in;
float16_t relu(const in uint32_t row, const in uint32_t col, const in float16_t x) { return max(x, float16_t(0)); }
float16_t add(const in uint32_t row, const in uint32_t col, const in float16_t x, const in float16_t y) { return x+y; }
float16_t combineSum(const in float16_t a, const in float16_t b) { return a + b; }
float16_t combineMax(const in float16_t a, const in float16_t b) { return max(a, b); }
layout(constant_id = 0) const uint32_t Dim = 32;
void main()
{
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA> A;
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseB> B;
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseAccumulator> Acc;
A = coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Acc);
B = coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseB>(Acc);
coopmat<float16_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseB> tr;
coopMatTransposeEXT(tr, Acc);
coopMatReduceEXT(Acc, Acc, gl_CooperativeMatrixReduceRowEXT, combineSum);
coopMatReduceEXT(Acc, Acc, gl_CooperativeMatrixReduceColumnEXT, combineSum);
coopMatReduceEXT(Acc, Acc, gl_CooperativeMatrixReduceRowAndColumnEXT, combineSum);
coopmat<float16_t, gl_ScopeWorkgroup, 32, 16, gl_MatrixUseAccumulator> Acc2x2;
coopMatReduceEXT(Acc2x2, Acc, gl_CooperativeMatrixReduce2x2EXT, combineMax);
coopMatPerElementEXT(Acc, Acc, relu);
coopMatPerElementEXT(Acc, Acc, add, float16_t(1.0));
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseAccumulator> Accf16;
coopmat<float32_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseAccumulator> Accf32;
coopmat<uint32_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseAccumulator> Accu32;
coopmat<int32_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseAccumulator> Accs32;
coopmat<uint8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accu32);
coopmat<int8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accu32);
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accu32);
coopmat<uint8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accs32);
coopmat<int8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accs32);
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accs32);
coopmat<uint8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accf16);
coopmat<int8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accf16);
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accf16);
coopmat<uint8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accf32);
coopmat<int8_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accf32);
coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accf32);
coopmat<uint32_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accs32);
coopmat<int32_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA>(Accu32);
coopmat<float, gl_ScopeWorkgroup, Dim, Dim, gl_MatrixUseAccumulator> li, mijm1;
mijm1 = coopmat<float, gl_ScopeWorkgroup, Dim, Dim, gl_MatrixUseAccumulator>(-1.0/0.0);
// New conversions in GL_EXT_cooperative_matrix_maintenance1:
Acc = coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseAccumulator>(A);
Acc = coopmat<float16_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseAccumulator>(B);
uint index = 1;
uvec2 coord;
coord = coopMatGetCoordinateEXT(A, index);
coord = coopMatGetCoordinateEXT(B, index);
coord = coopMatGetCoordinateEXT(Acc, index);
coopmat<uint8_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseA> Au8t;
coopmat<int8_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseA> As8t;
coopmat<float16_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseA> Af16t;
coopmat<int32_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseB> As32t;
coopmat<uint8_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseB> Bu8t;
coopmat<int8_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseB> Bs8t;
coopmat<float16_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseB> Bf16t;
coopmat<int32_t, gl_ScopeWorkgroup, 32, 64, gl_MatrixUseB> Bs32t;
coopMatTransposeEXT(Bu8t, Accf16);
coopMatTransposeEXT(Bs8t, Accf16);
coopMatTransposeEXT(Bf16t, Accf16);
coopMatTransposeEXT(Bu8t, Accf32);
coopMatTransposeEXT(Bs8t, Accf32);
coopMatTransposeEXT(Bf16t, Accf32);
coopMatTransposeEXT(Bu8t, Accs32);
coopMatTransposeEXT(Bs8t, Accs32);
coopMatTransposeEXT(Bf16t, Accs32);
coopMatTransposeEXT(Bu8t, Accu32);
coopMatTransposeEXT(Bs8t, Accu32);
coopMatTransposeEXT(Bf16t, Accu32);
coopMatTransposeEXT(Bs32t, Accu32);
coopmat<floate5m2_t, gl_ScopeWorkgroup, 64, 32, gl_MatrixUseA> matAe5m2;
saturatedConvertEXT(matAe5m2, Accf16);
coopMatTransposeEXT(Au8t, Accf16);
coopMatTransposeEXT(As8t, Accf16);
coopMatTransposeEXT(Af16t, Accf16);
coopMatTransposeEXT(Au8t, Accf32);
coopMatTransposeEXT(As8t, Accf32);
coopMatTransposeEXT(Af16t, Accf32);
coopMatTransposeEXT(Au8t, Accs32);
coopMatTransposeEXT(As8t, Accs32);
coopMatTransposeEXT(Af16t, Accs32);
coopMatTransposeEXT(Au8t, Accu32);
coopMatTransposeEXT(As8t, Accu32);
coopMatTransposeEXT(Af16t, Accu32);
coopMatTransposeEXT(As32t, Accu32);
}