PMADDWD
乘法和添加包装整数
stableVMJITAOTinstruction
编码
| 操作码 | 指令 | Op/En | 64 位 | 兼容/传统 | 说明 |
|---|---|---|---|---|---|
NP 0F F5 /r1 | PMADDWD mm, mm/m64 | A | 有效 | 有效 | 用毫米/m64的包装单词乘以毫米的包装单词,加入相邻的双词结果,以毫米存储. |
66 0F F5 /r | PMADDWD xmm1, xmm2/m128 | A | 有效 | 有效 | 将xmm1的包装单词整数乘以xmm2/m128的包装单词整数,加入相邻的双词结果,并存储在xmm1中. |
VEX.128.66.0F.WIG F5 /r | VPMADDWD xmm1, xmm2, xmm3/m128 | B | 有效 | 有效 | 将xmm2的包装单词整数乘以xmm3/m128的包装单词整数,加入相邻的双词结果,并存储在xmm1中. |
VEX.256.66.0F.WIG F5 /r | VPMADDWD ymm1, ymm2, ymm3/m256 | B | 有效 | 有效 | 将ymm2的包装单词整数乘以ymm3/m256的包装单词整数,加入相邻的双词结果,并存储在ymm1中. |
EVEX.128.66.0F.WIG F5 /r | VPMADDWD xmm1 {k1}{z}, xmm2, xmm3/m128 | C | 有效 | 有效 | 将打包的单词整数乘以xmm2由AVX512BW或组合的单词整数xmm3/m128,添加AVX10.1相邻双词结果,并存储于xmm1下级写掩码 k1. |
EVEX.256.66.0F.WIG F5 /r | VPMADDWD ymm1 {k1}{z}, ymm2, ymm3/m256 | C | 有效 | 有效 | 将打包的单词整数乘以ymm2由AVX512BW或组合的单词整数ymm3/m256,添加AVX10.1相邻双词结果,并存储于ymm1下级写掩码 k1. |
EVEX.512.66.0F.WIG F5 /r | VPMADDWD zmm1 {k1}{z}, zmm2, zmm3/m512 | C | 有效 | 有效 | 用 OR AVX10.1 将 zmm2 中包装的单词整数乘以 zmm3/m512 中包装的单词整数,加入相邻的双词结果,并在 writemask k1 下存储于 zmm1 中. |
操作数编码
每个模式对应上表 Op/En 列的一个取值,说明各操作数按书写顺序分别编码在指令的哪个字段,以及指令对它是读、是写还是两者兼有。
A
modrm.reglectura y escrituraModRM 字节的 reg 字段(第 5-3 位)modrm.rmlecturaModRM 字节的 r/m 字段(第 2-0 位);当 mod 字段要求时,还包括 SIB 字节和位移
B
modrm.regescrituraModRM 字节的 reg 字段(第 5-3 位)vex.vvvvlecturaVEX 前缀的 vvvv 字段(按位取反)modrm.rmlecturaModRM 字节的 r/m 字段(第 2-0 位);当 mod 字段要求时,还包括 SIB 字节和位移
C
modrm.regescrituraModRM 字节的 reg 字段(第 5-3 位)evex.vvvvlecturaEVEX 前缀的 vvvv 字段(按位取反)modrm.rmlecturaModRM 字节的 r/m 字段(第 2-0 位);当 mod 字段要求时,还包括 SIB 字节和位移
Tupla: Full Mem
实测开销
正在从 arch-data 加载实测数据...
说明
将目标操作数(第一个操作数)的个人签名单词乘以源操作数(第二个操作数)的相应签名单词,产生临时签名,双词的结果. 相邻的双词结果随后被归纳并存储在目标操作数中. 例如,源代码和目标操作数中对应的低序词(15-0)和31-16)相互乘以,双词结果加在一起并存储在目的地登记册的低序双词(31-0)中. 在相邻的其他对词上进行同样的操作. (图4-11在使用64位的操作数时显示此操作).
(V)PMADDWD的指令只在一种情况下环绕:当一组中运行的2对单词都是8000H时. 在这种情况下,结果被包裹到80000000H.
在64位模式中,没有用VEX/EVEX编码,使用REX前缀形式为REX.R允许此指令访问额外的注册(XMM8-XMM15).
遗产 SSE 版本 : 第一个来源和目标操作数是MMX登记册. 第二源操作数是一个MMX的寄存器或64位的内存位置.
128位遗产 SSE 版本 : 第一个来源和目标操作数是XMM登记册. 第二源操作数是一个XMM的寄存器或128位的内存位置. 相应的YMM目的地注册保持不变的位数(MAXVL-1:128).
VEX.128 编码版本 : 第一个来源和目标操作数是XMM登记册. 第二源操作数是一个XMM的寄存器或128位的内存位置. 目的地YMM的位数(MAXVL-1:128)登记被清零.
VEX.256 编码版本 : 第二源操作数可以是YMM的寄存器,也可以是256位的内存位置. 第一个来源和目标操作数是YMM登记册.
EVEX.512 编码版本 : 第二源操作数可以是ZMM寄存器或512位内存位置. 第一个来源和目标操作数是ZMM登记册.
SRC X3 X2 X1 X0DEST
Y3 Y2 Y1 Y0TEMP X3 Y3 X2 Y2 X1 Y1 X0 Y0
DEST (X3Y3) + (X2Y2) (X1Y1) + (X0Y0)图4-11. PMADDWD 使用64位 操作数 执行模型
行动
PMADDWD (With 64-bit Operands)
DEST[31:0] := (DEST[15:0] SRC[15:0]) + (DEST[31:16] SRC[31:16]);
DEST[63:32] := (DEST[47:32] SRC[47:32]) + (DEST[63:48] SRC[63:48]);
PMADDWD (With 128-bit Operands)
DEST[31:0] := (DEST[15:0] SRC[15:0]) + (DEST[31:16] SRC[31:16]);
DEST[63:32] := (DEST[47:32] SRC[47:32]) + (DEST[63:48] SRC[63:48]);
DEST[95:64] := (DEST[79:64] SRC[79:64]) + (DEST[95:80] SRC[95:80]);
DEST[127:96] := (DEST[111:96] SRC[111:96]) + (DEST[127:112] SRC[127:112]);
VPMADDWD (VEX.128 Encoded Version)
DEST[31:0] := (SRC1[15:0] * SRC2[15:0]) + (SRC1[31:16] * SRC2[31:16])
DEST[63:32] := (SRC1[47:32] * SRC2[47:32]) + (SRC1[63:48] * SRC2[63:48])
DEST[95:64] := (SRC1[79:64] * SRC2[79:64]) + (SRC1[95:80] * SRC2[95:80])
DEST[127:96] := (SRC1[111:96] * SRC2[111:96]) + (SRC1[127:112] * SRC2[127:112])
DEST[MAXVL-1:128] := 0
VPMADDWD (VEX.256 Encoded Version)
DEST[31:0] := (SRC1[15:0] * SRC2[15:0]) + (SRC1[31:16] * SRC2[31:16])
DEST[63:32] := (SRC1[47:32] * SRC2[47:32]) + (SRC1[63:48] * SRC2[63:48])
DEST[95:64] := (SRC1[79:64] * SRC2[79:64]) + (SRC1[95:80] * SRC2[95:80])
DEST[127:96] := (SRC1[111:96] * SRC2[111:96]) + (SRC1[127:112] * SRC2[127:112])
DEST[159:128] := (SRC1[143:128] * SRC2[143:128]) + (SRC1[159:144] * SRC2[159:144])
DEST[191:160] := (SRC1[175:160] * SRC2[175:160]) + (SRC1[191:176] * SRC2[191:176])
DEST[223:192] := (SRC1[207:192] * SRC2[207:192]) + (SRC1[223:208] * SRC2[223:208])
DEST[255:224] := (SRC1[239:224] * SRC2[239:224]) + (SRC1[255:240] * SRC2[255:240])
DEST[MAXVL-1:256] := 0
VPMADDWD (EVEX Encoded Versions)
(KL, VL) = (4, 128), (8, 256), (16, 512)
FOR j := 0 TO KL-1
i := j * 32
IF k1[j] OR *no writemask*
THEN DEST[i+31:i] := (SRC2[i+31:i+16]* SRC1[i+31:i+16]) + (SRC2[i+15:i]*SRC1[i+15:i])
ELSE
IF *merging-masking* ; merging-masking
THEN *DEST[i+31:i] remains unchanged*
ELSE *zeroing-masking* ; zeroing-masking
DEST[i+31:i] = 0
FI
FI;
ENDFOR;
DEST[MAXVL-1:VL] := 0Intel C/C++ 内在编译器
VPMADDWD __m512i _mm512_madd_epi16( __m512i a, __m512i b);
VPMADDWD __m512i _mm512_mask_madd_epi16(__m512i s, __mmask32 k, __m512i a, __m512i b);
VPMADDWD __m512i _mm512_maskz_madd_epi16( __mmask32 k, __m512i a, __m512i b);
VPMADDWD __m256i _mm256_mask_madd_epi16(__m256i s, __mmask16 k, __m256i a, __m256i b);
VPMADDWD __m256i _mm256_maskz_madd_epi16( __mmask16 k, __m256i a, __m256i b);
VPMADDWD __m128i _mm_mask_madd_epi16(__m128i s, __mmask8 k, __m128i a, __m128i b);
VPMADDWD __m128i _mm_maskz_madd_epi16( __mmask8 k, __m128i a, __m128i b);
PMADDWD __m64 _mm_madd_pi16(__m64 m1, __m64 m2) (V)PMADDWD __m128i _mm_madd_epi16 ( __m128i a, __m128i b) VPMADDWD __m256i _mm256_madd_epi16 ( __m256i a, __m256i b);受影响的旗帜
None.
数字例外
None.
其他例外
非EVEX-encoded指令,参见表2-21"第4类例外条件". EVEX-encoded指令,参见表2-52中的例外类型E4NF.nb,"Type E4NF Class Except Convention Centers".