SSSE3
Z Wikipedii
Supplemental Streaming SIMD Extension 3 (SSSE3) - zestaw instrukcji SSE czwartej generacji, rozszerzenie SSE3. SSSE3 jest błędnie nazywane jako SSE4, Tejas New Instructions (TNI) lub Merom New Instructions (MNI).
Spis treści |
[edytuj] Procesory obsługujące SSSE3
- Intel:
- Xeon 5100 Series
- Xeon 3000 Series
- Intel Core 2
[edytuj] Typy danych
Rozkazy SSSE3 nie wprowadzają nowych typów danych. Wszystkie wykonują działania całkowitoliczbowe, operując na typach wektorowych 64-bitowych (rejestry MMX), albo 128-bitowych (rejestry XMM).
[edytuj] Nowe instrukcje
SSSE3 wprowadza 16 nowych instrukcji w stosunku do swojego poprzednika SSE3. Wszystkie instrukcje działają na wektorach liczb całkowitych:
- PSIGNW, PSIGND, PSIGNB
- PABSW, PABSD, PABSB
- PHSUBW, PHSUBD
- PHSUBSW
- PHADDW, PHADDD
- PHADDSW
- PMULHRSW
- PMADDUBSW
- PSHUFB
- PALIGNR
[edytuj] PSIGNB, PSIGNW, PSIGND
Rozkazy działają — odpowiednio — na wektorach bajtów, słów bądź podwójnych słów ze znakiem, zmieniając znaki tych elementów w argumencie docelowym, dla których odpowiadające im elementy argumentu źródłowego są ujemne.
Np. rozkaz PSIGNW xmm1, xmm2 wykonuje:
for i:=0 to 7 do
if xmm2[i] < 0 then
xmm1[i] := - xmm1[i];
albo zapisując z wykorzystaniem funkcji signum:
for i:=0 to 7 do xmm[i] := xmm1[i] * SIGN(xmm2[i])
[edytuj] PABSB, PABSW, PABSD
Rozkazy działają - odpowiednio - na wektorach bajtów, słów bądź podwójnych słów ze znakiem, obliczając wartość bezwzględną każdego z elementów wektora źródłowego.
Np. rozkaz PABSB xmm1, xmm2 wykonuje:
for i:=0 to 15 do xmm1[i] := ABS(xmm2[i]);
[edytuj] PHADDW, PHADDD
Rozkazy działają − odpowiednio − na wektorach słów bądź podwójnych słów ze znakiem, wykonując dodawanie sąsiednich elementów.
Np. rozkazowi PHADDW xmm1, xmm2 odpowiada:
for i:=0 to 3 do
begin
temp[i] := xmm1[2*i] + xmm1[2*i+1]
temp[i+4] := xmm2[2*i] + xmm2[2*i+1]
end
[edytuj] PHADDSW
Rozkaz wykonuje to samo działanie co PHADDW, z tym, że wyniki dodawania są nasycane.
[edytuj] PHSUBW, PHSUBD
Rozkazy działają podobnie do PADDW/PADDD, z tą różnicą, że odejmują sąsiednie elementy; od elementu o indeksie parzystym odejmowany jest element o indeksie parzystym.
Np. rozkazowi PHSUBW xmm1, xmm2 odpowiada:
for i:=0 to 3 do
begin
temp[i] := xmm1[2*i] - xmm1[2*i+1]
temp[i+4] := xmm2[2*i] - xmm2[2*i+1]
end
[edytuj] PHSUBSW
Rozkaz wykonuje to samo działanie co PHSUBW, z tym, że wyniki odejmowania są nasycane.
[edytuj] PSHUFB
Rozkaz rozmieszcza elementy w wektorze bajtów zgodnie ze wzorcem zapisanym w wektorze źródłowym.
Każdy bajt wzorca określa, jaka wartość zostanie zapisana na odpowiadającej mu pozycji w wynikowym wektorze:
- jeśli najstarszy bit jest ustawiony, to zapisywany jest bajt o wartości zero
- w przeciwnym razie dwa lub trzy najmłodsze bity (zależnie, czy rozkaz działa na rejestrach XMM czy MMX) określają indeks bajtu w wektorze docelowym, który zostanie przepisany do wyniku.
Rozkaz PSHUFB xmm1, xmm2 (128-bitowe argumenty) wykonuje:
for i:=0 to 15 do
begin
if xmm2[i] AND 1000000b <> 0 then { ustawiony najstarszy bit }
temp[i] := 0
else
index = xmm2[i] AND 00000111b { albo indeks }
temp[i] := xmm1[index]
end
xmm1 := temp
Np. dla danych
0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
xmm2 = |0 |1 |2 |1 |3 |4 |5 |1 |6 |7 |0 |1 |2 |1 |7 |7 | (bajty jako liczby)
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
xmm1 = |W |i |k |p |e |d |a |- | | | | | | | | | (bajty jako znaki ASCII)
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
wynikiem działania PSHUFB xmm1, xmm2 będzie:
0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
xmm1 = |W |i |k |i |p |e |d |i |a |- |W |i |k |i |- |- |
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
[edytuj] PMULHRSW
Rozkaz mnoży wektory słów ze znakiem; wyniki mnożenia są zaokrąglane zgodnie z algorytmem:
- wynikiem mnożenia liczb 16-bitowych jest liczba 32-bitowa,
- z wyniku brane jest wartość pośrednia - 18 najstarszych bitów (tj. bity 14..31),
- która następnie zwiększana jest o 1,
- ostatecznie zapisuje się 16 najstarszych bitów z 18-bitowego wyniku pośredniego.
Np. rozkazowi PMULHRSW xmm1, xmm2 odpowiada:
for i:=0 to 7 do
begin
temp := xmm1[i] * xmm2[i]; { mnożenie 16-bitowych liczb }
temp := temp SAR 14; { 18 najstarszych bitów wyniku }
temp := temp + 1;
xmm1[i] := temp SAR 2; { 16 najstarszych bitów temp }
end
[edytuj] PMADDUBSW
Rozkaz wykonuje mnożenie dwóch wektorów bajtów, traktując bajty z wektora docelowego jako liczby bez znaku, natomiast ze źródłowego - ze znakiem; wynikiem pośrednim jest wektor 16-bitowych liczb ze znakiem. Następnie sąsiednie elementy tego wektora są do siebie dodawane (jak w rozkazie PHADDS), a wyniki nasycane - w przykładzie ostatniemu działaniu odpowiada psuedofunkcja Sat.
Np. rozkazowi PMADDUBSW xmm1, xmm2 odpowiada:
{ wektor pośredni }
for i:=0 to 15 do
temp[i] := xmm1[i] * xmm2[i]
{ sumowanie }
for i:=0 to 8 do
xmm1[i] := Sat(temp[2*i] + temp[2*i+1])
[edytuj] PALIGNR
Rozkaz łączy dwa 16-bajtowe wektory w jeden, 32-bajtowy, po czy wybiera z niego pewien zakres 16 bajtów i zapisuje w wektorze docelowym. Początek zakresu jest wskazywany przez trzeci argument rozkazu, 8-bitową stałą natychmiastową imm8.
Rozkazowi PALIGNR xmm1, xmm2, imm8 (128-bitowe argumenty, tj. 16-elementowe wektory) odpowiada
{ połączenie wektorów }
{ temp - wektor 32-elementowy }
for i := 0 to 15 do
temp[i] := xmm1[i]
temp[i+16] := xmm2[i]
{ wybranie fragmentu }
for i := 0 to 15 do
xmm1[i] := temp[i + imm8]
Np.
0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
xmm1 = |W |i |k |i |p |e |d |i |a |, | |W |o |l |n |a |
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
xmm2 = | |E |n |c |y |k |l |o |p |e |d |i |a | | | |
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
Wynik działania PALIGNR xmm1, xmm2, 11:
0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
xmm1 = |W |o |l |n |a | |E |n |c |y |k |l |o |p |e |d |
+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+--+
[edytuj] Bibliografia
- Intel 64 and IA-32 Architectures Software Developer's Manual: Volume 2B: Instruction Set Reference, N-Z (253667), maj 2007
[edytuj] Zobacz też
| Ekonomiści: Polska może uniknąć kryzysu |
|
Spowolnienie wzrostu gospodarczego w Polsce nie wynika ze złego funkcjonowania ekonomii; jest następstwem kryzysu finansowego w USA - uważają ekonomiści, uczestniczący w środę w debacie w Fundacji Batorego. Ich zdaniem trzeba szukać własnych recept na uniknięcie kłopotów gospodarczych.
|
| Kotecki: niższy wzrost PKB pomoże utrzymać niską inflację |
|
Niższy niż wcześniej zakładano wzrost gospodarczy w 2009 r. pomoże utrzymać inflację na niskim poziomie - powiedział w Sejmie wiceminister finansów Ludwik Kotecki, odpowiadając na pytania poselskie.
|
| Senat: podwyżki dla nauczycieli to dobry kierunek |
|
Planowane w przyszłym roku podwyżki dla nauczycieli to krok w dobrym kierunku - uznali zgodnie senatorowie podczas środowej debaty nad nowelizacją ustawy Karta Nauczyciela. Senatorowie PiS zaznaczyli jednak, że wysokość podwyżek jest niesatysfakcjonująca.
|
| Rząd obniżył prognozę wzrostu PKB w 2009 r. do 3,7 proc. |
|
Podczas drugiego czytania projektu ustawy budżetowej na 2009 r. rząd zgłosił poprawkę obniżającą prognozę przyszłorocznego wzrostu PKB z 4,8 proc. do 3,7 proc. Minister Finansów Jacek Rostowski nie wykluczył nowelizacji ustawy w przyszłym roku.
|
| Bill Richardson mianowany ministrem handlu USA |
|
Zgodnie z oczekiwaniami prezydent-elekt USA Barack Obama ogłosił w środę, że ministrem handlu w jego przyszłym gabinecie będzie gubernator stanu Nowy Meksyk Bill Richardson.
|