VPBROADCASTB, VPBROADCASTW, VPBROADCASTD, VPBROADCASTQ

从一般用途登记册装入广播整数数据

stableVMJITAOTinstruction

编码

操作码指令Op/En64 位兼容/传统说明
EVEX.128.66.0F38.W0 7A /rVPBROADCASTB xmm1 {k1}{z}, regA有效有效从一个 GPR 向 AVX512BW 中的所有字节播送一个 8 位值 OR AVX10.1 128 位目标以 写掩码 k1为对象.
EVEX.256.66.0F38.W0 7A /rVPBROADCASTB ymm1 {k1}{z}, regA有效有效从一个 GPR 向 AVX512BW 中的所有字节播送一个 8 位值 OR AVX10.1 256 位目标对象为 writemask k1.
EVEX.512.66.0F38.W0 7A /rVPBROADCASTB zmm1 {k1}{z}, regA有效有效从 GPR 向 OR AVX10.1 中的所有字节广播 8 位值 512 位值 以 写掩码 k1为对象.
EVEX.128.66.0F38.W0 7B /rVPBROADCASTW xmm1 {k1}{z}, regA有效有效从一个 GPR 向 AVX512BW 中的所有单词广播一个 16 位值 OR AVX10.1 128 位目标,以 写掩码 k1为对象.
EVEX.256.66.0F38.W0 7B /rVPBROADCASTW ymm1 {k1}{z}, regA有效有效从一个 GPR 广播一个 16 位值到所有 AVX512BW 中的单词 OR AVX10.1 共 256 位 对象为 writemask k1.
EVEX.512.66.0F38.W0 7B /rVPBROADCASTW zmm1 {k1}{z}, regA有效有效从一个 GPR 向 OR AVX10.1 中的所有字词广播一个 16 位值 512 位值 对象为 写掩码 k1.
EVEX.128.66.0F38.W0 7C /rVPBROADCASTD xmm1 {k1}{z}, r32A有效有效从一个GPR向所有AVX512F广播32位值) OR AVX10.1双字在128位目标对象写 k1.
EVEX.256.66.0F38.W0 7C /rVPBROADCASTD ymm1 {k1}{z}, r32A有效有效从一个GPR广播到所有AVX512F的32位值) OR AVX10.1 双字在256位对象为写掩码 k1.
EVEX.512.66.0F38.W0 7C /rVPBROADCASTD zmm1 {k1}{z}, r32A有效有效从 GPR 向 512 位元 目的地的所有 OR AVX10.1 双字广播 32 位元值, 可写入 k1 。
EVEX.128.66.0F38.W1 7C /rVPBROADCASTQ xmm1 {k1}{z}, r64A有效n.e.1从一个GPR广播到所有AVX512F的64位值) OR AVX10.1四字,在128位对象为写掩码 k1.
EVEX.256.66.0F38.W1 7C /rVPBROADCASTQ ymm1 {k1}{z}, r64A有效n.e.1从一个 GPR 广播到所有 AVX512F 的 64 位值 OR AVX10.1 的四字 256 位目标对象为 writemask k1.
EVEX.512.66.0F38.W1 7C /rVPBROADCASTQ zmm1 {k1}{z}, r64A有效n.e.1从一个 GPR 广播一个64位值到所有 OR AVX10.1 的 512 位元 目的地以 写掩码 k1 为对象的四字.

操作数编码

每个模式对应上表 Op/En 列的一个取值,说明各操作数按书写顺序分别编码在指令的哪个字段,以及指令对它是读、是写还是两者兼有。

A

  1. modrm.reg escrituraModRM 字节的 reg 字段(第 5-3 位)
  2. modrm.rm lecturaModRM 字节的 r/m 字段(第 2-0 位);当 mod 字段要求时,还包括 SIB 字节和位移

Tupla: Tuple1 Scalar

实测开销

正在从 arch-data 加载实测数据...

说明

从通用寄存器(第二部歌词)向目的地矢量寄存器(第一部歌词)中所有位置广播8位,16位,32位或64位的值,使用writemask k1.

EVEX.vvvv是保留的,必须是1111b,否则指令会#UD.

行动

VPBROADCASTB (EVEX encoded versions)

(KL, VL) = (16, 128), (32, 256), (64, 512)

FOR j := 0 TO KL-1

i := j * 8

IF k1[j] OR *no writemask*

     THEN DEST[i+7:i] := SRC[7:0]

     ELSE

             IF *merging-masking*           ; merging-masking

                 THEN *DEST[i+7:i] remains unchanged*

                 ELSE                       ; zeroing-masking

                    DEST[i+7:i] := 0

             FI

FI;

ENDFOR

DEST[MAXVL-1:VL] := 0

VPBROADCASTW (EVEX encoded versions)

(KL, VL) = (8, 128), (16, 256), (32, 512)

FOR j := 0 TO KL-1

i := j * 16

IF k1[j] OR *no writemask*

     THEN DEST[i+15:i] := SRC[15:0]

     ELSE

             IF *merging-masking*           ; merging-masking

                 THEN *DEST[i+15:i] remains unchanged*

                 ELSE                       ; zeroing-masking

                    DEST[i+15:i] := 0

             FI

FI;

ENDFOR

DEST[MAXVL-1:VL] := 0

VPBROADCASTD (EVEX encoded versions)

(KL, VL) = (4, 128), (8, 256), (16, 512)

FOR j := 0 TO KL-1

i := j * 32

IF k1[j] OR *no writemask*

     THEN DEST[i+31:i] := SRC[31:0]

     ELSE

             IF *merging-masking*           ; merging-masking

                 THEN *DEST[i+31:i] remains unchanged*

                 ELSE                       ; zeroing-masking

                    DEST[i+31:i] := 0

             FI

FI;

ENDFOR

DEST[MAXVL-1:VL] := 0


VPBROADCASTQ (EVEX encoded versions)

(KL, VL) = (2, 128), (4, 256), (8, 512)

FOR j := 0 TO KL-1

i := j * 64

IF k1[j] OR *no writemask*

     THEN DEST[i+63:i] := SRC[63:0]

     ELSE

             IF *merging-masking*        ; merging-masking

                 THEN *DEST[i+63:i] remains unchanged*

                 ELSE                    ; zeroing-masking

                    DEST[i+63:i] := 0

             FI

FI;

ENDFOR

DEST[MAXVL-1:VL] := 0

Intel C/C++ 内在编译器

VPBROADCASTB __m512i _mm512_mask_set1_epi8(__m512i s, __mmask64 k, int a);
VPBROADCASTB __m512i _mm512_maskz_set1_epi8( __mmask64 k, int a);
VPBROADCASTB __m256i _mm256_mask_set1_epi8(__m256i s, __mmask32 k, int a);
VPBROADCASTB __m256i _mm256_maskz_set1_epi8( __mmask32 k, int a);
VPBROADCASTB __m128i _mm_mask_set1_epi8(__m128i s, __mmask16 k, int a);
VPBROADCASTB __m128i _mm_maskz_set1_epi8( __mmask16 k, int a);
VPBROADCASTD __m512i _mm512_mask_set1_epi32(__m512i s, __mmask16 k, int a);
VPBROADCASTD __m512i _mm512_maskz_set1_epi32( __mmask16 k, int a);
VPBROADCASTD __m256i _mm256_mask_set1_epi32(__m256i s, __mmask8 k, int a);
VPBROADCASTD __m256i _mm256_maskz_set1_epi32( __mmask8 k, int a);
VPBROADCASTD __m128i _mm_mask_set1_epi32(__m128i s, __mmask8 k, int a);
VPBROADCASTD __m128i _mm_maskz_set1_epi32( __mmask8 k, int a);
VPBROADCASTQ __m512i _mm512_mask_set1_epi64(__m512i s, __mmask8 k, __int64 a);
VPBROADCASTQ __m512i _mm512_maskz_set1_epi64( __mmask8 k, __int64 a);
VPBROADCASTQ __m256i _mm256_mask_set1_epi64(__m256i s, __mmask8 k, __int64 a);
VPBROADCASTQ __m256i _mm256_maskz_set1_epi64( __mmask8 k, __int64 a);
VPBROADCASTQ __m128i _mm_mask_set1_epi64(__m128i s, __mmask8 k, __int64 a);
VPBROADCASTQ __m128i _mm_maskz_set1_epi64( __mmask8 k, __int64 a);
VPBROADCASTW __m512i _mm512_mask_set1_epi16(__m512i s, __mmask32 k, int a);
VPBROADCASTW __m512i _mm512_maskz_set1_epi16( __mmask32 k, int a);
VPBROADCASTW __m256i _mm256_mask_set1_epi16(__m256i s, __mmask16 k, int a);
VPBROADCASTW __m256i _mm256_maskz_set1_epi16( __mmask16 k, int a);
VPBROADCASTW __m128i _mm_mask_set1_epi16(__m128i s, __mmask8 k, int a);
VPBROADCASTW __m128i _mm_maskz_set1_epi16( __mmask8 k, int a);

来源