VPTERNLOGD, VPTERNLOGQ

位元逻辑

stableVMJITAOTinstruction

编码

操作码指令Op/En64 位兼容/传统说明
EVEX.128.66.0F3A.W0 25 /r ibVPTERNLOGD xmm1 {k1}{z}, xmm2, xmm3/m128/m32bcst, imm8A有效有效以 xmm1 、 xmm2 和 AVX512F ) OR xmm3/m128/m32bcst 作为 源操作数 和 AVX10.1 在 写掩码 和 k1 下将结果写入 xmm1 中。 直接值决定了正在执行的特定二进制函数 。
EVEX.256.66.0F3A.W0 25 /r ibVPTERNLOGD ymm1 {k1}{z}, ymm2, ymm3/m256/m32bcst, imm8A有效有效以 ymm1 、 ymm2 和 AVX512F ) OR ymm3/m256/m32bcst 作为 源操作数 和 AVX10.1 在 写掩码 和 k1 下将结果写入 ymm1 中。 直接值决定了正在执行的特定二进制函数 。
EVEX.512.66.0F3A.W0 25 /r ibVPTERNLOGD zmm1 {k1}{z}, zmm2, zmm3/m512/m32bcst, imm8A有效有效位元三进制逻辑zmm1, zmm2或AVX10.1 zmm3/m512/m32bcst 为源操作数并将结果写入zmm1下级写掩码 k1。即时值决定了正在执行的特定二进制函数。
EVEX.128.66.0F3A.W1 25 /r ibVPTERNLOGQ xmm1 {k1}{z}, xmm2, xmm3/m128/m64bcst, imm8A有效有效以 xmm1, xmm2, 和 AVX512F) OR xmm3/m128/m64bcst 作为 源操作数 和 AVX10.1 在 写掩码 和 k1 下将结果写入 xmm1 , 并带有 qword 颗粒性。 直接值决定了正在执行的特定二进制函数 。
EVEX.256.66.0F3A.W1 25 /r ibVPTERNLOGQ ymm1 {k1}{z}, ymm2, ymm3/m256/m64bcst, imm8A有效有效以 ymm1, ymm2, 和 AVX512F) OR ymm3/m256/m64bcst 作为 源操作数 和 AVX10.1 在 写掩码 和 k1 下将结果写入 ymm1 , 并带有 qword 颗粒性。 直接值决定了正在执行的特定二进制函数 。
EVEX.512.66.0F3A.W1 25 /r ibVPTERNLOGQ zmm1 {k1}{z}, zmm2, zmm3/m512/m64bcst, imm8A有效有效以 zmm1, zmm2, 和 OR AVX10.1 zmm3/m512/m64bcst 作为 源操作数 的位元逻辑, 在 写掩码 k1 下将结果写入 zmm1 。 直接值决定了执行中的特定二进制函数 。

操作数编码

每个模式对应上表 Op/En 列的一个取值,说明各操作数按书写顺序分别编码在指令的哪个字段,以及指令对它是读、是写还是两者兼有。

A

  1. modrm.reg lectura y escrituraModRM 字节的 reg 字段(第 5-3 位)
  2. evex.vvvv lecturaEVEX 前缀的 vvvv 字段(按位取反)
  3. modrm.rm lecturaModRM 字节的 r/m 字段(第 2-0 位);当 mod 字段要求时,还包括 SIB 字节和位移
  4. imm8指令后的立即数字节

Tupla: Full

实测开销

正在从 arch-data 加载实测数据...

说明

VPTERNLOGD/Q取3位向量长度为512位(在第一,第二,第三位操作数)作为输入数据,形成一组512指数,每个指数由每个输入向量的1位组成. Imm8字节指定了一个布尔逻辑表,为每个3位指数值产生二进制值. 最终的512位布尔结果被写入目标操作数(第一个操作数),使用写掩码 k1的颗粒性双字元素或四字元素进入目的地.

目标操作数是一个ZMM(EVEX.512)/YMM(EVEX.256)/XMM(EVEX.128)的登记册. 第一源操作数是一个ZMM/YMM/XMM登记册. 第二个源代码可是一个ZMM/YMM/XMM的寄存器,512/256/128位内存位置或512/256/128位内存位置广播的矢量. 目的地代码可是一个ZMM的寄存器,有条件的更新有writemask k1.

表5-20显示了由0xE2和0xE4直接值指定的布尔函数的两个实例,在包含3位索引所有可能值的三列之后的第四列中列出了抬头结果.

VPTERNLOGD/Q Imm8布尔函数和输入索引值实例

00000000
00110010
01000101
01100110
10001000
10111011
11011101
11111111

行动

VPTERNLOGD (EVEX encoded versions)

(KL, VL) = (4, 128), (8, 256), (16, 512)

FOR j := 0 TO KL-1

   i := j * 32

   IF k1[j] OR *no writemask*

        THEN

                FOR k := 0 TO 31

                IF (EVEX.b = 1) AND (SRC2 *is memory*)

                      THEN DEST[j][k] := imm[(DEST[i+k] << 2) + (SRC1[ i+k ] << 1) + SRC2[ k ]]

                      ELSE DEST[j][k] := imm[(DEST[i+k] << 2) + (SRC1[ i+k ] << 1) + SRC2[ i+k ]]

                FI;

                           ; table lookup of immediate bellow;

   ELSE

        IF *merging-masking*                 ; merging-masking

                THEN *DEST[31+i:i] remains unchanged*

                ELSE                         ; zeroing-masking

                DEST[31+i:i] := 0

        FI;

   FI;

ENDFOR;


DEST[MAXVL-1:VL] := 0

VPTERNLOGQ (EVEX encoded versions)

(KL, VL) = (2, 128), (4, 256), (8, 512)

FOR j := 0 TO KL-1

i := j * 64

IF k1[j] OR *no writemask*

     THEN

             FOR k := 0 TO 63

                  IF (EVEX.b = 1) AND (SRC2 *is memory*)

                       THEN DEST[j][k] := imm[(DEST[i+k] << 2) + (SRC1[ i+k ] << 1) + SRC2[ k ]]

                       ELSE DEST[j][k] := imm[(DEST[i+k] << 2) + (SRC1[ i+k ] << 1) + SRC2[ i+k ]]

                  FI;                    ; table lookup of immediate bellow;

     ELSE

             IF *merging-masking*             ; merging-masking

                  THEN *DEST[63+i:i] remains unchanged*

                  ELSE                        ; zeroing-masking

                       DEST[63+i:i] := 0

             FI;

FI;

ENDFOR;

DEST[MAXVL-1:VL] := 0

Intel C/C++ 内在编译器

VPTERNLOGD __m512i _mm512_ternarylogic_epi32(__m512i a, __m512i b, int imm);
VPTERNLOGD __m512i _mm512_mask_ternarylogic_epi32(__m512i s, __mmask16 m, __m512i a, __m512i b, int imm);
VPTERNLOGD __m512i _mm512_maskz_ternarylogic_epi32(__mmask m, __m512i a, __m512i b, int imm);
VPTERNLOGD __m256i _mm256_ternarylogic_epi32(__m256i a, __m256i b, int imm);
VPTERNLOGD __m256i _mm256_mask_ternarylogic_epi32(__m256i s, __mmask8 m, __m256i a, __m256i b, int imm);
VPTERNLOGD __m256i _mm256_maskz_ternarylogic_epi32( __mmask8 m, __m256i a, __m256i b, int imm);
VPTERNLOGD __m128i _mm_ternarylogic_epi32(__m128i a, __m128i b, int imm);
VPTERNLOGD __m128i _mm_mask_ternarylogic_epi32(__m128i s, __mmask8 m, __m128i a, __m128i b, int imm);
VPTERNLOGD __m128i _mm_maskz_ternarylogic_epi32( __mmask8 m, __m128i a, __m128i b, int imm);
VPTERNLOGQ __m512i _mm512_ternarylogic_epi64(__m512i a, __m512i b, int imm);
VPTERNLOGQ __m512i _mm512_mask_ternarylogic_epi64(__m512i s, __mmask8 m, __m512i a, __m512i b, int imm);
VPTERNLOGQ __m512i _mm512_maskz_ternarylogic_epi64( __mmask8 m, __m512i a, __m512i b, int imm);
VPTERNLOGQ __m256i _mm256_ternarylogic_epi64(__m256i a, __m256i b, int imm);
VPTERNLOGQ __m256i _mm256_mask_ternarylogic_epi64(__m256i s, __mmask8 m, __m256i a, __m256i b, int imm);
VPTERNLOGQ __m256i _mm256_maskz_ternarylogic_epi64( __mmask8 m, __m256i a, __m256i b, int imm);
VPTERNLOGQ __m128i _mm_ternarylogic_epi64(__m128i a, __m128i b, int imm);
VPTERNLOGQ __m128i _mm_mask_ternarylogic_epi64(__m128i s, __mmask8 m, __m128i a, __m128i b, int imm);
VPTERNLOGQ __m128i _mm_maskz_ternarylogic_epi64( __mmask8 m, __m128i a, __m128i b, int imm);

SIMD 浮点 例外

None.

其他例外

参见表2-51"E4类例外条件".

来源