VALIGND, VALIGNQ

Align Doubleword/Quadword Vectores

estableVMJITAOTinstruccion

Codificaciones

OpcodeInstruccionOp/En64 bitsCompat/LegacyDescripcion
EVEX.128.66.0F3A.W0 03 /r ibVALIGND xmm1 {k1}{z}, xmm2, xmm3/m128/m32bcst, imm8AValidoValidoShift right and merge vectors xmm2 y AVX512F) OR xmm3/m128/m32bcst con doble palabra granularidad AVX10.1 utilizando imm8 como número de elementos para cambiar, y almacenar el resultado final en xmm1, bajo máscara de escritura.
EVEX.128.66.0F3A.W1 03 /r ibVALIGNQ xmm1 {k1}{z}, xmm2, xmm3/m128/m64bcst, imm8AValidoValidoCambio derecho y fusión de vectoresxmm2yAVX512FOxmm3/m128/m64bcst con granularidad de cuadrículaAVX10.1utilizandoimm8como número de elementos para cambiar, y almacenar el resultado final enxmm1, bajomáscara de escritura.
EVEX.256.66.0F3A.W0 03 /r ibVALIGND ymm1 {k1}{z}, ymm2, ymm3/m256/m32bcst, imm8AValidoValidoShift right and merge vectors ymm2 y AVX512F) OR ymm3/m256/m32bcst con doble palabra granularidad AVX10.1 utilizando imm8 como número de elementos para cambiar, y almacenar el resultado final en ymm1, bajo máscara de escritura.
EVEX.256.66.0F3A.W1 03 /r ibVALIGNQ ymm1 {k1}{z}, ymm2, ymm3/m256/m64bcst, imm8AValidoValidoCambio derecho y fusión de vectoresymm2yAVX512FOymm3/m256/m64bcst con granularidad de cuadrículaAVX10.1utilizandoimm8como número de elementos para cambiar, y almacenar el resultado final enymm1, bajomáscara de escritura.
EVEX.512.66.0F3A.W0 03 /r ibVALIGND zmm1 {k1}{z}, zmm2, zmm3/m512/m32bcst, imm8AValidoValidoShift right and merge vectors zmm2 y OR AVX10.1 zmm3/m512/m32bcst con granularidad de doble palabra utilizando imm8 como número de elementos a cambiar, y almacenar el resultado final en zmm1, bajo máscara de escritura.
EVEX.512.66.0F3A.W1 03 /r ibVALIGNQ zmm1 {k1}{z}, zmm2, zmm3/m512/m64bcst, imm8AValidoValidoShift right and merge vectors zmm2 y OR AVX10.1 zmm3/m512/m64bcst con granularidad de cuád-word utilizando imm8 como número de elementos a cambiar, y almacenar el resultado final en zmm1, bajo máscara de escritura.

Codificacion de operandos

Cada modo es un valor de la columna Op/En de arriba. Dice en que campo de la instruccion codificada va cada operando, en el orden en que se escriben, y si la instruccion lo lee, lo escribe o ambas cosas.

A

  1. modrm.reg escriturabyte ModRM, campo reg (bits 5-3)
  2. evex.vvvv lecturaprefijo EVEX, campo vvvv (invertido)
  3. modrm.rm lecturabyte ModRM, campo r/m (bits 2-0); con el byte SIB y el desplazamiento cuando el campo mod los pide

Tupla: Full

Coste medido

Cargando las mediciones de arch-data...

Descripción

Concatena y cambia los elementos derecho de doble palabra/cuadword del primer operando de origen (el segundo operando) y el segundo operando de origen (el tercer operando) en un vector intermedio de 1024/512/256 bits. El bajo 512/256/128-bit del vector intermedio está escrito al operando de destino (el primer operando) utilizando la máscara de escritura k1. El destino y el primer operandos de origen son los registros ZMM/YMM/XMM. El segundo operando de origen puede ser un registro ZMM/YMM/XMM, un 512/256/128-bit ubicación de memoria o un vector 512/256/128-bit transmitido desde una ubicación de memoria de 32/64-bit.

Esta instrucción se escribe, por lo que sólo los elementos con el bit correspondiente fijado en el registro de máscaras vectoriales k1 se computan y almacenan en zmm1. Elementos en zmm1 con el bit correspondiente claro en k1 conservan sus valores anteriores (enmascaramiento emergente) o se fijan en 0 (enmascaramiento).

Operación

VALIGND (EVEX Encoded Versions)
(KL, VL) = (4, 128), (8, 256), (16, 512)

IF (SRC2 *is memory*) (AND EVEX.b = 1)

     THEN

          FOR j := 0 TO KL-1

                  i := j * 32

                  src[i+31:i] := SRC2[31:0]

          ENDFOR;

     ELSE src := SRC2

FI

; Concatenate sources

tmp[VL-1:0] := src[VL-1:0]

tmp[2VL-1:VL] := SRC1[VL-1:0]

; Shift right doubleword elements

IF VL = 128

     THEN SHIFT = imm8[1:0]

     ELSE

          IF VL = 256

                  THEN SHIFT = imm8[2:0]

                  ELSE SHIFT = imm8[3:0]

          FI

FI;

tmp[2VL-1:0] := tmp[2VL-1:0] >> (32*SHIFT)

; Apply writemask

FOR j := 0 TO KL-1

     i := j * 32

     IF k1[j] OR *no writemask*

          THEN DEST[i+31:i] := tmp[i+31:i]

          ELSE

                  IF *merging-masking*            ; merging-masking

                      THEN *DEST[i+31:i] remains unchanged*

                      ELSE                        ; zeroing-masking

                               DEST[i+31:i] := 0

                  FI

     FI;

ENDFOR;

DEST[MAXVL-1:VL] := 0

VALIGNQ (EVEX Encoded Versions)
(KL, VL) = (2, 128), (4, 256),(8, 512)
IF (SRC2 *is memory*) (AND EVEX.b = 1)

    THEN
          FOR j := 0 TO KL-1
                i := j * 64
                src[i+63:i] := SRC2[63:0]
          ENDFOR;

    ELSE src := SRC2
FI
; Concatenate sources
tmp[VL-1:0] := src[VL-1:0]
tmp[2VL-1:VL] := SRC1[VL-1:0]
; Shift right quadword elements


IF VL = 128

     THEN SHIFT = imm8[0]

     ELSE

          IF VL = 256

                  THEN SHIFT = imm8[1:0]

                  ELSE SHIFT = imm8[2:0]

          FI

FI;

tmp[2VL-1:0] := tmp[2VL-1:0] >> (64*SHIFT)

; Apply writemask

FOR j := 0 TO KL-1

     i := j * 64

     IF k1[j] OR *no writemask*

          THEN DEST[i+63:i] := tmp[i+63:i]

          ELSE

                  IF *merging-masking*      ; merging-masking

                      THEN *DEST[i+63:i] remains unchanged*

                      ELSE                  ; zeroing-masking

                       DEST[i+63:i] := 0

                  FI

     FI;

ENDFOR;

DEST[MAXVL-1:VL] := 0

Intel C/C++ compilador intrínseco

VALIGND __m512i _mm512_alignr_epi32( __m512i a, __m512i b, int cnt);
VALIGND __m512i _mm512_mask_alignr_epi32(__m512i s, __mmask16 k, __m512i a, __m512i b, int cnt);
VALIGND __m512i _mm512_maskz_alignr_epi32( __mmask16 k, __m512i a, __m512i b, int cnt);
VALIGND __m256i _mm256_mask_alignr_epi32(__m256i s, __mmask8 k, __m256i a, __m256i b, int cnt);
VALIGND __m256i _mm256_maskz_alignr_epi32( __mmask8 k, __m256i a, __m256i b, int cnt);
VALIGND __m128i _mm_mask_alignr_epi32(__m128i s, __mmask8 k, __m128i a, __m128i b, int cnt);
VALIGND __m128i _mm_maskz_alignr_epi32( __mmask8 k, __m128i a, __m128i b, int cnt);
VALIGNQ __m512i _mm512_alignr_epi64( __m512i a, __m512i b, int cnt);
VALIGNQ __m512i _mm512_mask_alignr_epi64(__m512i s, __mmask8 k, __m512i a, __m512i b, int cnt);
VALIGNQ __m512i _mm512_maskz_alignr_epi64( __mmask8 k, __m512i a, __m512i b, int cnt);
VALIGNQ __m256i _mm256_mask_alignr_epi64(__m256i s, __mmask8 k, __m256i a, __m256i b, int cnt);
VALIGNQ __m256i _mm256_maskz_alignr_epi64( __mmask8 k, __m256i a, __m256i b, int cnt);
VALIGNQ __m128i _mm_mask_alignr_epi64(__m128i s, __mmask8 k, __m128i a, __m128i b, int cnt);
VALIGNQ __m128i _mm_maskz_alignr_epi64( __mmask8 k, __m128i a, __m128i b, int cnt);

Fuentes