Coverage Report

Created: 2026-09-07 06:44

next uncovered line (L), next uncovered region (R), next uncovered branch (B)
/src/aom/aom_dsp/x86/intrapred_sse2.c
Line
Count
Source
1
/*
2
 * Copyright (c) 2017, Alliance for Open Media. All rights reserved.
3
 *
4
 * This source code is subject to the terms of the BSD 2 Clause License and
5
 * the Alliance for Open Media Patent License 1.0. If the BSD 2 Clause License
6
 * was not distributed with this source code in the LICENSE file, you can
7
 * obtain it at www.aomedia.org/license/software. If the Alliance for Open
8
 * Media Patent License 1.0 was not distributed with this source code in the
9
 * PATENTS file, you can obtain it at www.aomedia.org/license/patent.
10
 */
11
12
#include <emmintrin.h>
13
#include "aom_dsp/x86/intrapred_x86.h"
14
#include "config/aom_dsp_rtcd.h"
15
16
static inline void dc_store_4xh(uint32_t dc, int height, uint8_t *dst,
17
834k
                                ptrdiff_t stride) {
18
6.65M
  for (int i = 0; i < height; i += 2) {
19
5.81M
    *(uint32_t *)dst = dc;
20
5.81M
    dst += stride;
21
5.81M
    *(uint32_t *)dst = dc;
22
5.81M
    dst += stride;
23
5.81M
  }
24
834k
}
25
26
static inline void dc_store_8xh(const __m128i *row, int height, uint8_t *dst,
27
624k
                                ptrdiff_t stride) {
28
624k
  int i;
29
8.14M
  for (i = 0; i < height; ++i) {
30
7.51M
    _mm_storel_epi64((__m128i *)dst, *row);
31
7.51M
    dst += stride;
32
7.51M
  }
33
624k
}
34
35
static inline void dc_store_16xh(const __m128i *row, int height, uint8_t *dst,
36
1.04M
                                 ptrdiff_t stride) {
37
1.04M
  int i;
38
12.9M
  for (i = 0; i < height; ++i) {
39
11.8M
    _mm_store_si128((__m128i *)dst, *row);
40
11.8M
    dst += stride;
41
11.8M
  }
42
1.04M
}
43
44
static inline void dc_store_32xh(const __m128i *row, int height, uint8_t *dst,
45
275k
                                 ptrdiff_t stride) {
46
275k
  int i;
47
2.47M
  for (i = 0; i < height; ++i) {
48
2.20M
    _mm_store_si128((__m128i *)dst, *row);
49
2.20M
    _mm_store_si128((__m128i *)(dst + 16), *row);
50
2.20M
    dst += stride;
51
2.20M
  }
52
275k
}
53
54
static inline void dc_store_64xh(const __m128i *row, int height, uint8_t *dst,
55
0
                                 ptrdiff_t stride) {
56
0
  for (int i = 0; i < height; ++i) {
57
0
    _mm_store_si128((__m128i *)dst, *row);
58
0
    _mm_store_si128((__m128i *)(dst + 16), *row);
59
0
    _mm_store_si128((__m128i *)(dst + 32), *row);
60
0
    _mm_store_si128((__m128i *)(dst + 48), *row);
61
0
    dst += stride;
62
0
  }
63
0
}
64
65
1.59M
static inline __m128i dc_sum_4(const uint8_t *ref) {
66
1.59M
  __m128i x = _mm_loadl_epi64((__m128i const *)ref);
67
1.59M
  const __m128i zero = _mm_setzero_si128();
68
1.59M
  x = _mm_unpacklo_epi8(x, zero);
69
1.59M
  return _mm_sad_epu8(x, zero);
70
1.59M
}
71
72
1.29M
static inline __m128i dc_sum_8(const uint8_t *ref) {
73
1.29M
  __m128i x = _mm_loadl_epi64((__m128i const *)ref);
74
1.29M
  const __m128i zero = _mm_setzero_si128();
75
1.29M
  return _mm_sad_epu8(x, zero);
76
1.29M
}
77
78
17.5k
static inline __m128i dc_sum_64(const uint8_t *ref) {
79
17.5k
  __m128i x0 = _mm_load_si128((__m128i const *)ref);
80
17.5k
  __m128i x1 = _mm_load_si128((__m128i const *)(ref + 16));
81
17.5k
  __m128i x2 = _mm_load_si128((__m128i const *)(ref + 32));
82
17.5k
  __m128i x3 = _mm_load_si128((__m128i const *)(ref + 48));
83
17.5k
  const __m128i zero = _mm_setzero_si128();
84
17.5k
  x0 = _mm_sad_epu8(x0, zero);
85
17.5k
  x1 = _mm_sad_epu8(x1, zero);
86
17.5k
  x2 = _mm_sad_epu8(x2, zero);
87
17.5k
  x3 = _mm_sad_epu8(x3, zero);
88
17.5k
  x0 = _mm_add_epi16(x0, x1);
89
17.5k
  x2 = _mm_add_epi16(x2, x3);
90
17.5k
  x0 = _mm_add_epi16(x0, x2);
91
17.5k
  const __m128i high = _mm_unpackhi_epi64(x0, x0);
92
17.5k
  return _mm_add_epi16(x0, high);
93
17.5k
}
94
95
1.08M
#define DC_MULTIPLIER_1X2 0x5556
96
1.46M
#define DC_MULTIPLIER_1X4 0x3334
97
98
2.54M
#define DC_SHIFT2 16
99
100
static inline int divide_using_multiply_shift(int num, int shift1,
101
2.54M
                                              int multiplier) {
102
2.54M
  const int interm = num >> shift1;
103
2.54M
  return interm * multiplier >> DC_SHIFT2;
104
2.54M
}
105
106
// -----------------------------------------------------------------------------
107
// DC_PRED
108
109
void aom_dc_predictor_4x8_sse2(uint8_t *dst, ptrdiff_t stride,
110
184k
                               const uint8_t *above, const uint8_t *left) {
111
184k
  const __m128i sum_left = dc_sum_8(left);
112
184k
  __m128i sum_above = dc_sum_4(above);
113
184k
  sum_above = _mm_add_epi16(sum_left, sum_above);
114
115
184k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
116
184k
  sum += 6;
117
184k
  sum = divide_using_multiply_shift(sum, 2, DC_MULTIPLIER_1X2);
118
119
184k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
120
184k
  const uint32_t pred = (uint32_t)_mm_cvtsi128_si32(row);
121
184k
  dc_store_4xh(pred, 8, dst, stride);
122
184k
}
123
124
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
125
void aom_dc_predictor_4x16_sse2(uint8_t *dst, ptrdiff_t stride,
126
606k
                                const uint8_t *above, const uint8_t *left) {
127
606k
  const __m128i sum_left = dc_sum_16_sse2(left);
128
606k
  __m128i sum_above = dc_sum_4(above);
129
606k
  sum_above = _mm_add_epi16(sum_left, sum_above);
130
131
606k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
132
606k
  sum += 10;
133
606k
  sum = divide_using_multiply_shift(sum, 2, DC_MULTIPLIER_1X4);
134
135
606k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
136
606k
  const uint32_t pred = (uint32_t)_mm_cvtsi128_si32(row);
137
606k
  dc_store_4xh(pred, 16, dst, stride);
138
606k
}
139
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
140
141
void aom_dc_predictor_8x4_sse2(uint8_t *dst, ptrdiff_t stride,
142
303k
                               const uint8_t *above, const uint8_t *left) {
143
303k
  const __m128i sum_left = dc_sum_4(left);
144
303k
  __m128i sum_above = dc_sum_8(above);
145
303k
  sum_above = _mm_add_epi16(sum_above, sum_left);
146
147
303k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
148
303k
  sum += 6;
149
303k
  sum = divide_using_multiply_shift(sum, 2, DC_MULTIPLIER_1X2);
150
151
303k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
152
303k
  dc_store_8xh(&row, 4, dst, stride);
153
303k
}
154
155
void aom_dc_predictor_8x16_sse2(uint8_t *dst, ptrdiff_t stride,
156
165k
                                const uint8_t *above, const uint8_t *left) {
157
165k
  const __m128i sum_left = dc_sum_16_sse2(left);
158
165k
  __m128i sum_above = dc_sum_8(above);
159
165k
  sum_above = _mm_add_epi16(sum_above, sum_left);
160
161
165k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
162
165k
  sum += 12;
163
165k
  sum = divide_using_multiply_shift(sum, 3, DC_MULTIPLIER_1X2);
164
165k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
165
165k
  dc_store_8xh(&row, 16, dst, stride);
166
165k
}
167
168
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
169
void aom_dc_predictor_8x32_sse2(uint8_t *dst, ptrdiff_t stride,
170
84.3k
                                const uint8_t *above, const uint8_t *left) {
171
84.3k
  const __m128i sum_left = dc_sum_32_sse2(left);
172
84.3k
  __m128i sum_above = dc_sum_8(above);
173
84.3k
  sum_above = _mm_add_epi16(sum_above, sum_left);
174
175
84.3k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
176
84.3k
  sum += 20;
177
84.3k
  sum = divide_using_multiply_shift(sum, 3, DC_MULTIPLIER_1X4);
178
84.3k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
179
84.3k
  dc_store_8xh(&row, 32, dst, stride);
180
84.3k
}
181
182
void aom_dc_predictor_16x4_sse2(uint8_t *dst, ptrdiff_t stride,
183
489k
                                const uint8_t *above, const uint8_t *left) {
184
489k
  const __m128i sum_left = dc_sum_4(left);
185
489k
  __m128i sum_above = dc_sum_16_sse2(above);
186
489k
  sum_above = _mm_add_epi16(sum_above, sum_left);
187
188
489k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
189
489k
  sum += 10;
190
489k
  sum = divide_using_multiply_shift(sum, 2, DC_MULTIPLIER_1X4);
191
489k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
192
489k
  dc_store_16xh(&row, 4, dst, stride);
193
489k
}
194
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
195
196
void aom_dc_predictor_16x8_sse2(uint8_t *dst, ptrdiff_t stride,
197
272k
                                const uint8_t *above, const uint8_t *left) {
198
272k
  const __m128i sum_left = dc_sum_8(left);
199
272k
  __m128i sum_above = dc_sum_16_sse2(above);
200
272k
  sum_above = _mm_add_epi16(sum_above, sum_left);
201
202
272k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
203
272k
  sum += 12;
204
272k
  sum = divide_using_multiply_shift(sum, 3, DC_MULTIPLIER_1X2);
205
272k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
206
272k
  dc_store_16xh(&row, 8, dst, stride);
207
272k
}
208
209
void aom_dc_predictor_16x32_sse2(uint8_t *dst, ptrdiff_t stride,
210
158k
                                 const uint8_t *above, const uint8_t *left) {
211
158k
  const __m128i sum_left = dc_sum_32_sse2(left);
212
158k
  __m128i sum_above = dc_sum_16_sse2(above);
213
158k
  sum_above = _mm_add_epi16(sum_left, sum_above);
214
215
158k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
216
158k
  sum += 24;
217
158k
  sum = divide_using_multiply_shift(sum, 4, DC_MULTIPLIER_1X2);
218
158k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
219
158k
  dc_store_16xh(&row, 32, dst, stride);
220
158k
}
221
222
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
223
void aom_dc_predictor_16x64_sse2(uint8_t *dst, ptrdiff_t stride,
224
17.1k
                                 const uint8_t *above, const uint8_t *left) {
225
17.1k
  const __m128i sum_left = dc_sum_64(left);
226
17.1k
  __m128i sum_above = dc_sum_16_sse2(above);
227
17.1k
  sum_above = _mm_add_epi16(sum_left, sum_above);
228
229
17.1k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
230
17.1k
  sum += 40;
231
17.1k
  sum = divide_using_multiply_shift(sum, 4, DC_MULTIPLIER_1X4);
232
17.1k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
233
17.1k
  dc_store_16xh(&row, 64, dst, stride);
234
17.1k
}
235
236
void aom_dc_predictor_32x8_sse2(uint8_t *dst, ptrdiff_t stride,
237
263k
                                const uint8_t *above, const uint8_t *left) {
238
263k
  __m128i sum_above = dc_sum_32_sse2(above);
239
263k
  const __m128i sum_left = dc_sum_8(left);
240
263k
  sum_above = _mm_add_epi16(sum_above, sum_left);
241
242
263k
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
243
263k
  sum += 20;
244
263k
  sum = divide_using_multiply_shift(sum, 3, DC_MULTIPLIER_1X4);
245
263k
  const __m128i row = _mm_set1_epi8((int8_t)sum);
246
263k
  dc_store_32xh(&row, 8, dst, stride);
247
263k
}
248
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
249
250
void aom_dc_predictor_32x16_sse2(uint8_t *dst, ptrdiff_t stride,
251
0
                                 const uint8_t *above, const uint8_t *left) {
252
0
  __m128i sum_above = dc_sum_32_sse2(above);
253
0
  const __m128i sum_left = dc_sum_16_sse2(left);
254
0
  sum_above = _mm_add_epi16(sum_above, sum_left);
255
256
0
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
257
0
  sum += 24;
258
0
  sum = divide_using_multiply_shift(sum, 4, DC_MULTIPLIER_1X2);
259
0
  const __m128i row = _mm_set1_epi8((int8_t)sum);
260
0
  dc_store_32xh(&row, 16, dst, stride);
261
0
}
262
263
void aom_dc_predictor_32x64_sse2(uint8_t *dst, ptrdiff_t stride,
264
0
                                 const uint8_t *above, const uint8_t *left) {
265
0
  __m128i sum_above = dc_sum_32_sse2(above);
266
0
  const __m128i sum_left = dc_sum_64(left);
267
0
  sum_above = _mm_add_epi16(sum_above, sum_left);
268
269
0
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
270
0
  sum += 48;
271
0
  sum = divide_using_multiply_shift(sum, 5, DC_MULTIPLIER_1X2);
272
0
  const __m128i row = _mm_set1_epi8((int8_t)sum);
273
0
  dc_store_32xh(&row, 64, dst, stride);
274
0
}
275
276
void aom_dc_predictor_64x64_sse2(uint8_t *dst, ptrdiff_t stride,
277
0
                                 const uint8_t *above, const uint8_t *left) {
278
0
  __m128i sum_above = dc_sum_64(above);
279
0
  const __m128i sum_left = dc_sum_64(left);
280
0
  sum_above = _mm_add_epi16(sum_above, sum_left);
281
282
0
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
283
0
  sum += 64;
284
0
  sum /= 128;
285
0
  const __m128i row = _mm_set1_epi8((int8_t)sum);
286
0
  dc_store_64xh(&row, 64, dst, stride);
287
0
}
288
289
void aom_dc_predictor_64x32_sse2(uint8_t *dst, ptrdiff_t stride,
290
0
                                 const uint8_t *above, const uint8_t *left) {
291
0
  __m128i sum_above = dc_sum_64(above);
292
0
  const __m128i sum_left = dc_sum_32_sse2(left);
293
0
  sum_above = _mm_add_epi16(sum_above, sum_left);
294
295
0
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
296
0
  sum += 48;
297
0
  sum = divide_using_multiply_shift(sum, 5, DC_MULTIPLIER_1X2);
298
0
  const __m128i row = _mm_set1_epi8((int8_t)sum);
299
0
  dc_store_64xh(&row, 32, dst, stride);
300
0
}
301
302
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
303
void aom_dc_predictor_64x16_sse2(uint8_t *dst, ptrdiff_t stride,
304
0
                                 const uint8_t *above, const uint8_t *left) {
305
0
  __m128i sum_above = dc_sum_64(above);
306
0
  const __m128i sum_left = dc_sum_16_sse2(left);
307
0
  sum_above = _mm_add_epi16(sum_above, sum_left);
308
309
0
  uint32_t sum = (uint32_t)_mm_cvtsi128_si32(sum_above);
310
0
  sum += 40;
311
0
  sum = divide_using_multiply_shift(sum, 4, DC_MULTIPLIER_1X4);
312
0
  const __m128i row = _mm_set1_epi8((int8_t)sum);
313
0
  dc_store_64xh(&row, 16, dst, stride);
314
0
}
315
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
316
317
// -----------------------------------------------------------------------------
318
// DC_TOP
319
320
void aom_dc_top_predictor_4x8_sse2(uint8_t *dst, ptrdiff_t stride,
321
3.59k
                                   const uint8_t *above, const uint8_t *left) {
322
3.59k
  (void)left;
323
3.59k
  __m128i sum_above = dc_sum_4(above);
324
3.59k
  const __m128i two = _mm_set1_epi16(2);
325
3.59k
  sum_above = _mm_add_epi16(sum_above, two);
326
3.59k
  sum_above = _mm_srai_epi16(sum_above, 2);
327
3.59k
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
328
3.59k
  sum_above = _mm_packus_epi16(sum_above, sum_above);
329
330
3.59k
  const uint32_t pred = (uint32_t)_mm_cvtsi128_si32(sum_above);
331
3.59k
  dc_store_4xh(pred, 8, dst, stride);
332
3.59k
}
333
334
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
335
void aom_dc_top_predictor_4x16_sse2(uint8_t *dst, ptrdiff_t stride,
336
2.90k
                                    const uint8_t *above, const uint8_t *left) {
337
2.90k
  (void)left;
338
2.90k
  __m128i sum_above = dc_sum_4(above);
339
2.90k
  const __m128i two = _mm_set1_epi16(2);
340
2.90k
  sum_above = _mm_add_epi16(sum_above, two);
341
2.90k
  sum_above = _mm_srai_epi16(sum_above, 2);
342
2.90k
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
343
2.90k
  sum_above = _mm_packus_epi16(sum_above, sum_above);
344
345
2.90k
  const uint32_t pred = (uint32_t)_mm_cvtsi128_si32(sum_above);
346
2.90k
  dc_store_4xh(pred, 16, dst, stride);
347
2.90k
}
348
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
349
350
void aom_dc_top_predictor_8x4_sse2(uint8_t *dst, ptrdiff_t stride,
351
2.66k
                                   const uint8_t *above, const uint8_t *left) {
352
2.66k
  (void)left;
353
2.66k
  __m128i sum_above = dc_sum_8(above);
354
2.66k
  const __m128i four = _mm_set1_epi16(4);
355
2.66k
  sum_above = _mm_add_epi16(sum_above, four);
356
2.66k
  sum_above = _mm_srai_epi16(sum_above, 3);
357
2.66k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
358
2.66k
  const __m128i row = _mm_shufflelo_epi16(sum_above, 0);
359
2.66k
  dc_store_8xh(&row, 4, dst, stride);
360
2.66k
}
361
362
void aom_dc_top_predictor_8x16_sse2(uint8_t *dst, ptrdiff_t stride,
363
2.48k
                                    const uint8_t *above, const uint8_t *left) {
364
2.48k
  (void)left;
365
2.48k
  __m128i sum_above = dc_sum_8(above);
366
2.48k
  const __m128i four = _mm_set1_epi16(4);
367
2.48k
  sum_above = _mm_add_epi16(sum_above, four);
368
2.48k
  sum_above = _mm_srai_epi16(sum_above, 3);
369
2.48k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
370
2.48k
  const __m128i row = _mm_shufflelo_epi16(sum_above, 0);
371
2.48k
  dc_store_8xh(&row, 16, dst, stride);
372
2.48k
}
373
374
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
375
void aom_dc_top_predictor_8x32_sse2(uint8_t *dst, ptrdiff_t stride,
376
3.08k
                                    const uint8_t *above, const uint8_t *left) {
377
3.08k
  (void)left;
378
3.08k
  __m128i sum_above = dc_sum_8(above);
379
3.08k
  const __m128i four = _mm_set1_epi16(4);
380
3.08k
  sum_above = _mm_add_epi16(sum_above, four);
381
3.08k
  sum_above = _mm_srai_epi16(sum_above, 3);
382
3.08k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
383
3.08k
  const __m128i row = _mm_shufflelo_epi16(sum_above, 0);
384
3.08k
  dc_store_8xh(&row, 32, dst, stride);
385
3.08k
}
386
387
void aom_dc_top_predictor_16x4_sse2(uint8_t *dst, ptrdiff_t stride,
388
8.99k
                                    const uint8_t *above, const uint8_t *left) {
389
8.99k
  (void)left;
390
8.99k
  __m128i sum_above = dc_sum_16_sse2(above);
391
8.99k
  const __m128i eight = _mm_set1_epi16(8);
392
8.99k
  sum_above = _mm_add_epi16(sum_above, eight);
393
8.99k
  sum_above = _mm_srai_epi16(sum_above, 4);
394
8.99k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
395
8.99k
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
396
8.99k
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
397
8.99k
  dc_store_16xh(&row, 4, dst, stride);
398
8.99k
}
399
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
400
401
void aom_dc_top_predictor_16x8_sse2(uint8_t *dst, ptrdiff_t stride,
402
2.36k
                                    const uint8_t *above, const uint8_t *left) {
403
2.36k
  (void)left;
404
2.36k
  __m128i sum_above = dc_sum_16_sse2(above);
405
2.36k
  const __m128i eight = _mm_set1_epi16(8);
406
2.36k
  sum_above = _mm_add_epi16(sum_above, eight);
407
2.36k
  sum_above = _mm_srai_epi16(sum_above, 4);
408
2.36k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
409
2.36k
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
410
2.36k
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
411
2.36k
  dc_store_16xh(&row, 8, dst, stride);
412
2.36k
}
413
414
void aom_dc_top_predictor_16x32_sse2(uint8_t *dst, ptrdiff_t stride,
415
                                     const uint8_t *above,
416
15.6k
                                     const uint8_t *left) {
417
15.6k
  (void)left;
418
15.6k
  __m128i sum_above = dc_sum_16_sse2(above);
419
15.6k
  const __m128i eight = _mm_set1_epi16(8);
420
15.6k
  sum_above = _mm_add_epi16(sum_above, eight);
421
15.6k
  sum_above = _mm_srai_epi16(sum_above, 4);
422
15.6k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
423
15.6k
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
424
15.6k
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
425
15.6k
  dc_store_16xh(&row, 32, dst, stride);
426
15.6k
}
427
428
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
429
void aom_dc_top_predictor_16x64_sse2(uint8_t *dst, ptrdiff_t stride,
430
                                     const uint8_t *above,
431
1.08k
                                     const uint8_t *left) {
432
1.08k
  (void)left;
433
1.08k
  __m128i sum_above = dc_sum_16_sse2(above);
434
1.08k
  const __m128i eight = _mm_set1_epi16(8);
435
1.08k
  sum_above = _mm_add_epi16(sum_above, eight);
436
1.08k
  sum_above = _mm_srai_epi16(sum_above, 4);
437
1.08k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
438
1.08k
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
439
1.08k
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
440
1.08k
  dc_store_16xh(&row, 64, dst, stride);
441
1.08k
}
442
443
void aom_dc_top_predictor_32x8_sse2(uint8_t *dst, ptrdiff_t stride,
444
9.11k
                                    const uint8_t *above, const uint8_t *left) {
445
9.11k
  (void)left;
446
9.11k
  __m128i sum_above = dc_sum_32_sse2(above);
447
9.11k
  const __m128i sixteen = _mm_set1_epi16(16);
448
9.11k
  sum_above = _mm_add_epi16(sum_above, sixteen);
449
9.11k
  sum_above = _mm_srai_epi16(sum_above, 5);
450
9.11k
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
451
9.11k
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
452
9.11k
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
453
9.11k
  dc_store_32xh(&row, 8, dst, stride);
454
9.11k
}
455
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
456
457
void aom_dc_top_predictor_32x16_sse2(uint8_t *dst, ptrdiff_t stride,
458
                                     const uint8_t *above,
459
0
                                     const uint8_t *left) {
460
0
  (void)left;
461
0
  __m128i sum_above = dc_sum_32_sse2(above);
462
0
  const __m128i sixteen = _mm_set1_epi16(16);
463
0
  sum_above = _mm_add_epi16(sum_above, sixteen);
464
0
  sum_above = _mm_srai_epi16(sum_above, 5);
465
0
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
466
0
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
467
0
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
468
0
  dc_store_32xh(&row, 16, dst, stride);
469
0
}
470
471
void aom_dc_top_predictor_32x64_sse2(uint8_t *dst, ptrdiff_t stride,
472
                                     const uint8_t *above,
473
0
                                     const uint8_t *left) {
474
0
  (void)left;
475
0
  __m128i sum_above = dc_sum_32_sse2(above);
476
0
  const __m128i sixteen = _mm_set1_epi16(16);
477
0
  sum_above = _mm_add_epi16(sum_above, sixteen);
478
0
  sum_above = _mm_srai_epi16(sum_above, 5);
479
0
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
480
0
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
481
0
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
482
0
  dc_store_32xh(&row, 64, dst, stride);
483
0
}
484
485
void aom_dc_top_predictor_64x64_sse2(uint8_t *dst, ptrdiff_t stride,
486
                                     const uint8_t *above,
487
0
                                     const uint8_t *left) {
488
0
  (void)left;
489
0
  __m128i sum_above = dc_sum_64(above);
490
0
  const __m128i thirtytwo = _mm_set1_epi16(32);
491
0
  sum_above = _mm_add_epi16(sum_above, thirtytwo);
492
0
  sum_above = _mm_srai_epi16(sum_above, 6);
493
0
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
494
0
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
495
0
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
496
0
  dc_store_64xh(&row, 64, dst, stride);
497
0
}
498
499
void aom_dc_top_predictor_64x32_sse2(uint8_t *dst, ptrdiff_t stride,
500
                                     const uint8_t *above,
501
0
                                     const uint8_t *left) {
502
0
  (void)left;
503
0
  __m128i sum_above = dc_sum_64(above);
504
0
  const __m128i thirtytwo = _mm_set1_epi16(32);
505
0
  sum_above = _mm_add_epi16(sum_above, thirtytwo);
506
0
  sum_above = _mm_srai_epi16(sum_above, 6);
507
0
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
508
0
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
509
0
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
510
0
  dc_store_64xh(&row, 32, dst, stride);
511
0
}
512
513
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
514
void aom_dc_top_predictor_64x16_sse2(uint8_t *dst, ptrdiff_t stride,
515
                                     const uint8_t *above,
516
0
                                     const uint8_t *left) {
517
0
  (void)left;
518
0
  __m128i sum_above = dc_sum_64(above);
519
0
  const __m128i thirtytwo = _mm_set1_epi16(32);
520
0
  sum_above = _mm_add_epi16(sum_above, thirtytwo);
521
0
  sum_above = _mm_srai_epi16(sum_above, 6);
522
0
  sum_above = _mm_unpacklo_epi8(sum_above, sum_above);
523
0
  sum_above = _mm_shufflelo_epi16(sum_above, 0);
524
0
  const __m128i row = _mm_unpacklo_epi64(sum_above, sum_above);
525
0
  dc_store_64xh(&row, 16, dst, stride);
526
0
}
527
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
528
529
// -----------------------------------------------------------------------------
530
// DC_LEFT
531
532
void aom_dc_left_predictor_4x8_sse2(uint8_t *dst, ptrdiff_t stride,
533
5.38k
                                    const uint8_t *above, const uint8_t *left) {
534
5.38k
  (void)above;
535
5.38k
  __m128i sum_left = dc_sum_8(left);
536
5.38k
  const __m128i four = _mm_set1_epi16(4);
537
5.38k
  sum_left = _mm_add_epi16(sum_left, four);
538
5.38k
  sum_left = _mm_srai_epi16(sum_left, 3);
539
5.38k
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
540
5.38k
  sum_left = _mm_packus_epi16(sum_left, sum_left);
541
542
5.38k
  const uint32_t pred = (uint32_t)_mm_cvtsi128_si32(sum_left);
543
5.38k
  dc_store_4xh(pred, 8, dst, stride);
544
5.38k
}
545
546
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
547
void aom_dc_left_predictor_4x16_sse2(uint8_t *dst, ptrdiff_t stride,
548
                                     const uint8_t *above,
549
4.72k
                                     const uint8_t *left) {
550
4.72k
  (void)above;
551
4.72k
  __m128i sum_left = dc_sum_16_sse2(left);
552
4.72k
  const __m128i eight = _mm_set1_epi16(8);
553
4.72k
  sum_left = _mm_add_epi16(sum_left, eight);
554
4.72k
  sum_left = _mm_srai_epi16(sum_left, 4);
555
4.72k
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
556
4.72k
  sum_left = _mm_packus_epi16(sum_left, sum_left);
557
558
4.72k
  const uint32_t pred = (uint32_t)_mm_cvtsi128_si32(sum_left);
559
4.72k
  dc_store_4xh(pred, 16, dst, stride);
560
4.72k
}
561
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
562
563
void aom_dc_left_predictor_8x4_sse2(uint8_t *dst, ptrdiff_t stride,
564
3.82k
                                    const uint8_t *above, const uint8_t *left) {
565
3.82k
  (void)above;
566
3.82k
  __m128i sum_left = dc_sum_4(left);
567
3.82k
  const __m128i two = _mm_set1_epi16(2);
568
3.82k
  sum_left = _mm_add_epi16(sum_left, two);
569
3.82k
  sum_left = _mm_srai_epi16(sum_left, 2);
570
3.82k
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
571
3.82k
  const __m128i row = _mm_shufflelo_epi16(sum_left, 0);
572
3.82k
  dc_store_8xh(&row, 4, dst, stride);
573
3.82k
}
574
575
void aom_dc_left_predictor_8x16_sse2(uint8_t *dst, ptrdiff_t stride,
576
                                     const uint8_t *above,
577
4.37k
                                     const uint8_t *left) {
578
4.37k
  (void)above;
579
4.37k
  __m128i sum_left = dc_sum_16_sse2(left);
580
4.37k
  const __m128i eight = _mm_set1_epi16(8);
581
4.37k
  sum_left = _mm_add_epi16(sum_left, eight);
582
4.37k
  sum_left = _mm_srai_epi16(sum_left, 4);
583
4.37k
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
584
4.37k
  const __m128i row = _mm_shufflelo_epi16(sum_left, 0);
585
4.37k
  dc_store_8xh(&row, 16, dst, stride);
586
4.37k
}
587
588
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
589
void aom_dc_left_predictor_8x32_sse2(uint8_t *dst, ptrdiff_t stride,
590
                                     const uint8_t *above,
591
8.92k
                                     const uint8_t *left) {
592
8.92k
  (void)above;
593
8.92k
  __m128i sum_left = dc_sum_32_sse2(left);
594
8.92k
  const __m128i sixteen = _mm_set1_epi16(16);
595
8.92k
  sum_left = _mm_add_epi16(sum_left, sixteen);
596
8.92k
  sum_left = _mm_srai_epi16(sum_left, 5);
597
8.92k
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
598
8.92k
  const __m128i row = _mm_shufflelo_epi16(sum_left, 0);
599
8.92k
  dc_store_8xh(&row, 32, dst, stride);
600
8.92k
}
601
602
void aom_dc_left_predictor_16x4_sse2(uint8_t *dst, ptrdiff_t stride,
603
                                     const uint8_t *above,
604
4.22k
                                     const uint8_t *left) {
605
4.22k
  (void)above;
606
4.22k
  __m128i sum_left = dc_sum_4(left);
607
4.22k
  const __m128i two = _mm_set1_epi16(2);
608
4.22k
  sum_left = _mm_add_epi16(sum_left, two);
609
4.22k
  sum_left = _mm_srai_epi16(sum_left, 2);
610
4.22k
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
611
4.22k
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
612
4.22k
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
613
4.22k
  dc_store_16xh(&row, 4, dst, stride);
614
4.22k
}
615
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
616
617
void aom_dc_left_predictor_16x8_sse2(uint8_t *dst, ptrdiff_t stride,
618
                                     const uint8_t *above,
619
8.49k
                                     const uint8_t *left) {
620
8.49k
  (void)above;
621
8.49k
  __m128i sum_left = dc_sum_8(left);
622
8.49k
  const __m128i four = _mm_set1_epi16(4);
623
8.49k
  sum_left = _mm_add_epi16(sum_left, four);
624
8.49k
  sum_left = _mm_srai_epi16(sum_left, 3);
625
8.49k
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
626
8.49k
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
627
8.49k
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
628
8.49k
  dc_store_16xh(&row, 8, dst, stride);
629
8.49k
}
630
631
void aom_dc_left_predictor_16x32_sse2(uint8_t *dst, ptrdiff_t stride,
632
                                      const uint8_t *above,
633
5.33k
                                      const uint8_t *left) {
634
5.33k
  (void)above;
635
5.33k
  __m128i sum_left = dc_sum_32_sse2(left);
636
5.33k
  const __m128i sixteen = _mm_set1_epi16(16);
637
5.33k
  sum_left = _mm_add_epi16(sum_left, sixteen);
638
5.33k
  sum_left = _mm_srai_epi16(sum_left, 5);
639
5.33k
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
640
5.33k
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
641
5.33k
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
642
5.33k
  dc_store_16xh(&row, 32, dst, stride);
643
5.33k
}
644
645
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
646
void aom_dc_left_predictor_16x64_sse2(uint8_t *dst, ptrdiff_t stride,
647
                                      const uint8_t *above,
648
399
                                      const uint8_t *left) {
649
399
  (void)above;
650
399
  __m128i sum_left = dc_sum_64(left);
651
399
  const __m128i thirtytwo = _mm_set1_epi16(32);
652
399
  sum_left = _mm_add_epi16(sum_left, thirtytwo);
653
399
  sum_left = _mm_srai_epi16(sum_left, 6);
654
399
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
655
399
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
656
399
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
657
399
  dc_store_16xh(&row, 64, dst, stride);
658
399
}
659
660
void aom_dc_left_predictor_32x8_sse2(uint8_t *dst, ptrdiff_t stride,
661
                                     const uint8_t *above,
662
2.30k
                                     const uint8_t *left) {
663
2.30k
  (void)above;
664
2.30k
  __m128i sum_left = dc_sum_8(left);
665
2.30k
  const __m128i four = _mm_set1_epi16(4);
666
2.30k
  sum_left = _mm_add_epi16(sum_left, four);
667
2.30k
  sum_left = _mm_srai_epi16(sum_left, 3);
668
2.30k
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
669
2.30k
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
670
2.30k
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
671
2.30k
  dc_store_32xh(&row, 8, dst, stride);
672
2.30k
}
673
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
674
675
void aom_dc_left_predictor_32x16_sse2(uint8_t *dst, ptrdiff_t stride,
676
                                      const uint8_t *above,
677
0
                                      const uint8_t *left) {
678
0
  (void)above;
679
0
  __m128i sum_left = dc_sum_16_sse2(left);
680
0
  const __m128i eight = _mm_set1_epi16(8);
681
0
  sum_left = _mm_add_epi16(sum_left, eight);
682
0
  sum_left = _mm_srai_epi16(sum_left, 4);
683
0
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
684
0
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
685
0
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
686
0
  dc_store_32xh(&row, 16, dst, stride);
687
0
}
688
689
void aom_dc_left_predictor_32x64_sse2(uint8_t *dst, ptrdiff_t stride,
690
                                      const uint8_t *above,
691
0
                                      const uint8_t *left) {
692
0
  (void)above;
693
0
  __m128i sum_left = dc_sum_64(left);
694
0
  const __m128i thirtytwo = _mm_set1_epi16(32);
695
0
  sum_left = _mm_add_epi16(sum_left, thirtytwo);
696
0
  sum_left = _mm_srai_epi16(sum_left, 6);
697
0
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
698
0
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
699
0
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
700
0
  dc_store_32xh(&row, 64, dst, stride);
701
0
}
702
703
void aom_dc_left_predictor_64x64_sse2(uint8_t *dst, ptrdiff_t stride,
704
                                      const uint8_t *above,
705
0
                                      const uint8_t *left) {
706
0
  (void)above;
707
0
  __m128i sum_left = dc_sum_64(left);
708
0
  const __m128i thirtytwo = _mm_set1_epi16(32);
709
0
  sum_left = _mm_add_epi16(sum_left, thirtytwo);
710
0
  sum_left = _mm_srai_epi16(sum_left, 6);
711
0
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
712
0
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
713
0
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
714
0
  dc_store_64xh(&row, 64, dst, stride);
715
0
}
716
717
void aom_dc_left_predictor_64x32_sse2(uint8_t *dst, ptrdiff_t stride,
718
                                      const uint8_t *above,
719
0
                                      const uint8_t *left) {
720
0
  (void)above;
721
0
  __m128i sum_left = dc_sum_32_sse2(left);
722
0
  const __m128i sixteen = _mm_set1_epi16(16);
723
0
  sum_left = _mm_add_epi16(sum_left, sixteen);
724
0
  sum_left = _mm_srai_epi16(sum_left, 5);
725
0
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
726
0
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
727
0
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
728
0
  dc_store_64xh(&row, 32, dst, stride);
729
0
}
730
731
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
732
void aom_dc_left_predictor_64x16_sse2(uint8_t *dst, ptrdiff_t stride,
733
                                      const uint8_t *above,
734
0
                                      const uint8_t *left) {
735
0
  (void)above;
736
0
  __m128i sum_left = dc_sum_16_sse2(left);
737
0
  const __m128i eight = _mm_set1_epi16(8);
738
0
  sum_left = _mm_add_epi16(sum_left, eight);
739
0
  sum_left = _mm_srai_epi16(sum_left, 4);
740
0
  sum_left = _mm_unpacklo_epi8(sum_left, sum_left);
741
0
  sum_left = _mm_shufflelo_epi16(sum_left, 0);
742
0
  const __m128i row = _mm_unpacklo_epi64(sum_left, sum_left);
743
0
  dc_store_64xh(&row, 16, dst, stride);
744
0
}
745
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
746
747
// -----------------------------------------------------------------------------
748
// DC_128
749
750
void aom_dc_128_predictor_4x8_sse2(uint8_t *dst, ptrdiff_t stride,
751
2.43k
                                   const uint8_t *above, const uint8_t *left) {
752
2.43k
  (void)above;
753
2.43k
  (void)left;
754
2.43k
  const uint32_t pred = 0x80808080;
755
2.43k
  dc_store_4xh(pred, 8, dst, stride);
756
2.43k
}
757
758
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
759
void aom_dc_128_predictor_4x16_sse2(uint8_t *dst, ptrdiff_t stride,
760
261
                                    const uint8_t *above, const uint8_t *left) {
761
261
  (void)above;
762
261
  (void)left;
763
261
  const uint32_t pred = 0x80808080;
764
261
  dc_store_4xh(pred, 16, dst, stride);
765
261
}
766
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
767
768
void aom_dc_128_predictor_8x4_sse2(uint8_t *dst, ptrdiff_t stride,
769
588
                                   const uint8_t *above, const uint8_t *left) {
770
588
  (void)above;
771
588
  (void)left;
772
588
  const __m128i row = _mm_set1_epi8((int8_t)128);
773
588
  dc_store_8xh(&row, 4, dst, stride);
774
588
}
775
776
void aom_dc_128_predictor_8x16_sse2(uint8_t *dst, ptrdiff_t stride,
777
1.18k
                                    const uint8_t *above, const uint8_t *left) {
778
1.18k
  (void)above;
779
1.18k
  (void)left;
780
1.18k
  const __m128i row = _mm_set1_epi8((int8_t)128);
781
1.18k
  dc_store_8xh(&row, 16, dst, stride);
782
1.18k
}
783
784
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
785
void aom_dc_128_predictor_8x32_sse2(uint8_t *dst, ptrdiff_t stride,
786
300
                                    const uint8_t *above, const uint8_t *left) {
787
300
  (void)above;
788
300
  (void)left;
789
300
  const __m128i row = _mm_set1_epi8((int8_t)128);
790
300
  dc_store_8xh(&row, 32, dst, stride);
791
300
}
792
793
void aom_dc_128_predictor_16x4_sse2(uint8_t *dst, ptrdiff_t stride,
794
184
                                    const uint8_t *above, const uint8_t *left) {
795
184
  (void)above;
796
184
  (void)left;
797
184
  const __m128i row = _mm_set1_epi8((int8_t)128);
798
184
  dc_store_16xh(&row, 4, dst, stride);
799
184
}
800
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
801
802
void aom_dc_128_predictor_16x8_sse2(uint8_t *dst, ptrdiff_t stride,
803
299
                                    const uint8_t *above, const uint8_t *left) {
804
299
  (void)above;
805
299
  (void)left;
806
299
  const __m128i row = _mm_set1_epi8((int8_t)128);
807
299
  dc_store_16xh(&row, 8, dst, stride);
808
299
}
809
810
void aom_dc_128_predictor_16x32_sse2(uint8_t *dst, ptrdiff_t stride,
811
                                     const uint8_t *above,
812
2.28k
                                     const uint8_t *left) {
813
2.28k
  (void)above;
814
2.28k
  (void)left;
815
2.28k
  const __m128i row = _mm_set1_epi8((int8_t)128);
816
2.28k
  dc_store_16xh(&row, 32, dst, stride);
817
2.28k
}
818
819
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
820
void aom_dc_128_predictor_16x64_sse2(uint8_t *dst, ptrdiff_t stride,
821
                                     const uint8_t *above,
822
202
                                     const uint8_t *left) {
823
202
  (void)above;
824
202
  (void)left;
825
202
  const __m128i row = _mm_set1_epi8((int8_t)128);
826
202
  dc_store_16xh(&row, 64, dst, stride);
827
202
}
828
829
void aom_dc_128_predictor_32x8_sse2(uint8_t *dst, ptrdiff_t stride,
830
190
                                    const uint8_t *above, const uint8_t *left) {
831
190
  (void)above;
832
190
  (void)left;
833
190
  const __m128i row = _mm_set1_epi8((int8_t)128);
834
190
  dc_store_32xh(&row, 8, dst, stride);
835
190
}
836
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
837
838
void aom_dc_128_predictor_32x16_sse2(uint8_t *dst, ptrdiff_t stride,
839
                                     const uint8_t *above,
840
0
                                     const uint8_t *left) {
841
0
  (void)above;
842
0
  (void)left;
843
0
  const __m128i row = _mm_set1_epi8((int8_t)128);
844
0
  dc_store_32xh(&row, 16, dst, stride);
845
0
}
846
847
void aom_dc_128_predictor_32x64_sse2(uint8_t *dst, ptrdiff_t stride,
848
                                     const uint8_t *above,
849
0
                                     const uint8_t *left) {
850
0
  (void)above;
851
0
  (void)left;
852
0
  const __m128i row = _mm_set1_epi8((int8_t)128);
853
0
  dc_store_32xh(&row, 64, dst, stride);
854
0
}
855
856
void aom_dc_128_predictor_64x64_sse2(uint8_t *dst, ptrdiff_t stride,
857
                                     const uint8_t *above,
858
0
                                     const uint8_t *left) {
859
0
  (void)above;
860
0
  (void)left;
861
0
  const __m128i row = _mm_set1_epi8((int8_t)128);
862
0
  dc_store_64xh(&row, 64, dst, stride);
863
0
}
864
865
void aom_dc_128_predictor_64x32_sse2(uint8_t *dst, ptrdiff_t stride,
866
                                     const uint8_t *above,
867
0
                                     const uint8_t *left) {
868
0
  (void)above;
869
0
  (void)left;
870
0
  const __m128i row = _mm_set1_epi8((int8_t)128);
871
0
  dc_store_64xh(&row, 32, dst, stride);
872
0
}
873
874
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
875
void aom_dc_128_predictor_64x16_sse2(uint8_t *dst, ptrdiff_t stride,
876
                                     const uint8_t *above,
877
0
                                     const uint8_t *left) {
878
0
  (void)above;
879
0
  (void)left;
880
0
  const __m128i row = _mm_set1_epi8((int8_t)128);
881
0
  dc_store_64xh(&row, 16, dst, stride);
882
0
}
883
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
884
885
// -----------------------------------------------------------------------------
886
// V_PRED
887
888
void aom_v_predictor_4x8_sse2(uint8_t *dst, ptrdiff_t stride,
889
19.0k
                              const uint8_t *above, const uint8_t *left) {
890
19.0k
  const uint32_t pred = *(uint32_t *)above;
891
19.0k
  (void)left;
892
19.0k
  dc_store_4xh(pred, 8, dst, stride);
893
19.0k
}
894
895
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
896
void aom_v_predictor_4x16_sse2(uint8_t *dst, ptrdiff_t stride,
897
5.76k
                               const uint8_t *above, const uint8_t *left) {
898
5.76k
  const uint32_t pred = *(uint32_t *)above;
899
5.76k
  (void)left;
900
5.76k
  dc_store_4xh(pred, 16, dst, stride);
901
5.76k
}
902
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
903
904
void aom_v_predictor_8x4_sse2(uint8_t *dst, ptrdiff_t stride,
905
28.5k
                              const uint8_t *above, const uint8_t *left) {
906
28.5k
  const __m128i row = _mm_loadl_epi64((__m128i const *)above);
907
28.5k
  (void)left;
908
28.5k
  dc_store_8xh(&row, 4, dst, stride);
909
28.5k
}
910
911
void aom_v_predictor_8x16_sse2(uint8_t *dst, ptrdiff_t stride,
912
12.1k
                               const uint8_t *above, const uint8_t *left) {
913
12.1k
  const __m128i row = _mm_loadl_epi64((__m128i const *)above);
914
12.1k
  (void)left;
915
12.1k
  dc_store_8xh(&row, 16, dst, stride);
916
12.1k
}
917
918
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
919
void aom_v_predictor_8x32_sse2(uint8_t *dst, ptrdiff_t stride,
920
3.05k
                               const uint8_t *above, const uint8_t *left) {
921
3.05k
  const __m128i row = _mm_loadl_epi64((__m128i const *)above);
922
3.05k
  (void)left;
923
3.05k
  dc_store_8xh(&row, 32, dst, stride);
924
3.05k
}
925
926
void aom_v_predictor_16x4_sse2(uint8_t *dst, ptrdiff_t stride,
927
25.1k
                               const uint8_t *above, const uint8_t *left) {
928
25.1k
  const __m128i row = _mm_load_si128((__m128i const *)above);
929
25.1k
  (void)left;
930
25.1k
  dc_store_16xh(&row, 4, dst, stride);
931
25.1k
}
932
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
933
934
void aom_v_predictor_16x8_sse2(uint8_t *dst, ptrdiff_t stride,
935
23.3k
                               const uint8_t *above, const uint8_t *left) {
936
23.3k
  const __m128i row = _mm_load_si128((__m128i const *)above);
937
23.3k
  (void)left;
938
23.3k
  dc_store_16xh(&row, 8, dst, stride);
939
23.3k
}
940
941
void aom_v_predictor_16x32_sse2(uint8_t *dst, ptrdiff_t stride,
942
7.18k
                                const uint8_t *above, const uint8_t *left) {
943
7.18k
  const __m128i row = _mm_load_si128((__m128i const *)above);
944
7.18k
  (void)left;
945
7.18k
  dc_store_16xh(&row, 32, dst, stride);
946
7.18k
}
947
948
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
949
void aom_v_predictor_16x64_sse2(uint8_t *dst, ptrdiff_t stride,
950
1.13k
                                const uint8_t *above, const uint8_t *left) {
951
1.13k
  const __m128i row = _mm_load_si128((__m128i const *)above);
952
1.13k
  (void)left;
953
1.13k
  dc_store_16xh(&row, 64, dst, stride);
954
1.13k
}
955
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
956
957
static inline void v_predictor_32xh(uint8_t *dst, ptrdiff_t stride,
958
9.58k
                                    const uint8_t *above, int height) {
959
9.58k
  const __m128i row0 = _mm_load_si128((__m128i const *)above);
960
9.58k
  const __m128i row1 = _mm_load_si128((__m128i const *)(above + 16));
961
86.2k
  for (int i = 0; i < height; ++i) {
962
76.6k
    _mm_store_si128((__m128i *)dst, row0);
963
76.6k
    _mm_store_si128((__m128i *)(dst + 16), row1);
964
76.6k
    dst += stride;
965
76.6k
  }
966
9.58k
}
967
968
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
969
void aom_v_predictor_32x8_sse2(uint8_t *dst, ptrdiff_t stride,
970
9.58k
                               const uint8_t *above, const uint8_t *left) {
971
9.58k
  (void)left;
972
9.58k
  v_predictor_32xh(dst, stride, above, 8);
973
9.58k
}
974
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
975
976
void aom_v_predictor_32x16_sse2(uint8_t *dst, ptrdiff_t stride,
977
0
                                const uint8_t *above, const uint8_t *left) {
978
0
  (void)left;
979
0
  v_predictor_32xh(dst, stride, above, 16);
980
0
}
981
982
void aom_v_predictor_32x64_sse2(uint8_t *dst, ptrdiff_t stride,
983
0
                                const uint8_t *above, const uint8_t *left) {
984
0
  (void)left;
985
0
  v_predictor_32xh(dst, stride, above, 64);
986
0
}
987
988
static inline void v_predictor_64xh(uint8_t *dst, ptrdiff_t stride,
989
0
                                    const uint8_t *above, int height) {
990
0
  const __m128i row0 = _mm_load_si128((__m128i const *)above);
991
0
  const __m128i row1 = _mm_load_si128((__m128i const *)(above + 16));
992
0
  const __m128i row2 = _mm_load_si128((__m128i const *)(above + 32));
993
0
  const __m128i row3 = _mm_load_si128((__m128i const *)(above + 48));
994
0
  for (int i = 0; i < height; ++i) {
995
0
    _mm_store_si128((__m128i *)dst, row0);
996
0
    _mm_store_si128((__m128i *)(dst + 16), row1);
997
0
    _mm_store_si128((__m128i *)(dst + 32), row2);
998
0
    _mm_store_si128((__m128i *)(dst + 48), row3);
999
0
    dst += stride;
1000
0
  }
1001
0
}
1002
1003
void aom_v_predictor_64x64_sse2(uint8_t *dst, ptrdiff_t stride,
1004
0
                                const uint8_t *above, const uint8_t *left) {
1005
0
  (void)left;
1006
0
  v_predictor_64xh(dst, stride, above, 64);
1007
0
}
1008
1009
void aom_v_predictor_64x32_sse2(uint8_t *dst, ptrdiff_t stride,
1010
0
                                const uint8_t *above, const uint8_t *left) {
1011
0
  (void)left;
1012
0
  v_predictor_64xh(dst, stride, above, 32);
1013
0
}
1014
1015
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1016
void aom_v_predictor_64x16_sse2(uint8_t *dst, ptrdiff_t stride,
1017
0
                                const uint8_t *above, const uint8_t *left) {
1018
0
  (void)left;
1019
0
  v_predictor_64xh(dst, stride, above, 16);
1020
0
}
1021
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1022
1023
// -----------------------------------------------------------------------------
1024
// H_PRED
1025
1026
void aom_h_predictor_4x8_sse2(uint8_t *dst, ptrdiff_t stride,
1027
27.5k
                              const uint8_t *above, const uint8_t *left) {
1028
27.5k
  (void)above;
1029
27.5k
  __m128i left_col = _mm_loadl_epi64((__m128i const *)left);
1030
27.5k
  left_col = _mm_unpacklo_epi8(left_col, left_col);
1031
27.5k
  __m128i row0 = _mm_shufflelo_epi16(left_col, 0);
1032
27.5k
  __m128i row1 = _mm_shufflelo_epi16(left_col, 0x55);
1033
27.5k
  __m128i row2 = _mm_shufflelo_epi16(left_col, 0xaa);
1034
27.5k
  __m128i row3 = _mm_shufflelo_epi16(left_col, 0xff);
1035
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row0);
1036
27.5k
  dst += stride;
1037
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row1);
1038
27.5k
  dst += stride;
1039
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row2);
1040
27.5k
  dst += stride;
1041
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row3);
1042
27.5k
  dst += stride;
1043
27.5k
  left_col = _mm_unpackhi_epi64(left_col, left_col);
1044
27.5k
  row0 = _mm_shufflelo_epi16(left_col, 0);
1045
27.5k
  row1 = _mm_shufflelo_epi16(left_col, 0x55);
1046
27.5k
  row2 = _mm_shufflelo_epi16(left_col, 0xaa);
1047
27.5k
  row3 = _mm_shufflelo_epi16(left_col, 0xff);
1048
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row0);
1049
27.5k
  dst += stride;
1050
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row1);
1051
27.5k
  dst += stride;
1052
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row2);
1053
27.5k
  dst += stride;
1054
27.5k
  *(int *)dst = _mm_cvtsi128_si32(row3);
1055
27.5k
}
1056
1057
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1058
void aom_h_predictor_4x16_sse2(uint8_t *dst, ptrdiff_t stride,
1059
17.6k
                               const uint8_t *above, const uint8_t *left) {
1060
17.6k
  (void)above;
1061
17.6k
  const __m128i left_col = _mm_load_si128((__m128i const *)left);
1062
17.6k
  __m128i left_col_low = _mm_unpacklo_epi8(left_col, left_col);
1063
17.6k
  __m128i left_col_high = _mm_unpackhi_epi8(left_col, left_col);
1064
1065
17.6k
  __m128i row0 = _mm_shufflelo_epi16(left_col_low, 0);
1066
17.6k
  __m128i row1 = _mm_shufflelo_epi16(left_col_low, 0x55);
1067
17.6k
  __m128i row2 = _mm_shufflelo_epi16(left_col_low, 0xaa);
1068
17.6k
  __m128i row3 = _mm_shufflelo_epi16(left_col_low, 0xff);
1069
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row0);
1070
17.6k
  dst += stride;
1071
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row1);
1072
17.6k
  dst += stride;
1073
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row2);
1074
17.6k
  dst += stride;
1075
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row3);
1076
17.6k
  dst += stride;
1077
1078
17.6k
  left_col_low = _mm_unpackhi_epi64(left_col_low, left_col_low);
1079
17.6k
  row0 = _mm_shufflelo_epi16(left_col_low, 0);
1080
17.6k
  row1 = _mm_shufflelo_epi16(left_col_low, 0x55);
1081
17.6k
  row2 = _mm_shufflelo_epi16(left_col_low, 0xaa);
1082
17.6k
  row3 = _mm_shufflelo_epi16(left_col_low, 0xff);
1083
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row0);
1084
17.6k
  dst += stride;
1085
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row1);
1086
17.6k
  dst += stride;
1087
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row2);
1088
17.6k
  dst += stride;
1089
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row3);
1090
17.6k
  dst += stride;
1091
1092
17.6k
  row0 = _mm_shufflelo_epi16(left_col_high, 0);
1093
17.6k
  row1 = _mm_shufflelo_epi16(left_col_high, 0x55);
1094
17.6k
  row2 = _mm_shufflelo_epi16(left_col_high, 0xaa);
1095
17.6k
  row3 = _mm_shufflelo_epi16(left_col_high, 0xff);
1096
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row0);
1097
17.6k
  dst += stride;
1098
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row1);
1099
17.6k
  dst += stride;
1100
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row2);
1101
17.6k
  dst += stride;
1102
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row3);
1103
17.6k
  dst += stride;
1104
1105
17.6k
  left_col_high = _mm_unpackhi_epi64(left_col_high, left_col_high);
1106
17.6k
  row0 = _mm_shufflelo_epi16(left_col_high, 0);
1107
17.6k
  row1 = _mm_shufflelo_epi16(left_col_high, 0x55);
1108
17.6k
  row2 = _mm_shufflelo_epi16(left_col_high, 0xaa);
1109
17.6k
  row3 = _mm_shufflelo_epi16(left_col_high, 0xff);
1110
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row0);
1111
17.6k
  dst += stride;
1112
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row1);
1113
17.6k
  dst += stride;
1114
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row2);
1115
17.6k
  dst += stride;
1116
17.6k
  *(int *)dst = _mm_cvtsi128_si32(row3);
1117
17.6k
}
1118
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1119
1120
void aom_h_predictor_8x4_sse2(uint8_t *dst, ptrdiff_t stride,
1121
49.8k
                              const uint8_t *above, const uint8_t *left) {
1122
49.8k
  (void)above;
1123
49.8k
  __m128i left_col = _mm_loadl_epi64((__m128i const *)left);
1124
49.8k
  left_col = _mm_unpacklo_epi8(left_col, left_col);
1125
49.8k
  __m128i row0 = _mm_shufflelo_epi16(left_col, 0);
1126
49.8k
  __m128i row1 = _mm_shufflelo_epi16(left_col, 0x55);
1127
49.8k
  __m128i row2 = _mm_shufflelo_epi16(left_col, 0xaa);
1128
49.8k
  __m128i row3 = _mm_shufflelo_epi16(left_col, 0xff);
1129
49.8k
  _mm_storel_epi64((__m128i *)dst, row0);
1130
49.8k
  dst += stride;
1131
49.8k
  _mm_storel_epi64((__m128i *)dst, row1);
1132
49.8k
  dst += stride;
1133
49.8k
  _mm_storel_epi64((__m128i *)dst, row2);
1134
49.8k
  dst += stride;
1135
49.8k
  _mm_storel_epi64((__m128i *)dst, row3);
1136
49.8k
}
1137
1138
static inline void h_predictor_8x16xc(uint8_t *dst, ptrdiff_t stride,
1139
                                      const uint8_t *above, const uint8_t *left,
1140
37.6k
                                      int count) {
1141
37.6k
  (void)above;
1142
84.5k
  for (int i = 0; i < count; ++i) {
1143
46.8k
    const __m128i left_col = _mm_load_si128((__m128i const *)left);
1144
46.8k
    __m128i left_col_low = _mm_unpacklo_epi8(left_col, left_col);
1145
46.8k
    __m128i left_col_high = _mm_unpackhi_epi8(left_col, left_col);
1146
1147
46.8k
    __m128i row0 = _mm_shufflelo_epi16(left_col_low, 0);
1148
46.8k
    __m128i row1 = _mm_shufflelo_epi16(left_col_low, 0x55);
1149
46.8k
    __m128i row2 = _mm_shufflelo_epi16(left_col_low, 0xaa);
1150
46.8k
    __m128i row3 = _mm_shufflelo_epi16(left_col_low, 0xff);
1151
46.8k
    _mm_storel_epi64((__m128i *)dst, row0);
1152
46.8k
    dst += stride;
1153
46.8k
    _mm_storel_epi64((__m128i *)dst, row1);
1154
46.8k
    dst += stride;
1155
46.8k
    _mm_storel_epi64((__m128i *)dst, row2);
1156
46.8k
    dst += stride;
1157
46.8k
    _mm_storel_epi64((__m128i *)dst, row3);
1158
46.8k
    dst += stride;
1159
1160
46.8k
    left_col_low = _mm_unpackhi_epi64(left_col_low, left_col_low);
1161
46.8k
    row0 = _mm_shufflelo_epi16(left_col_low, 0);
1162
46.8k
    row1 = _mm_shufflelo_epi16(left_col_low, 0x55);
1163
46.8k
    row2 = _mm_shufflelo_epi16(left_col_low, 0xaa);
1164
46.8k
    row3 = _mm_shufflelo_epi16(left_col_low, 0xff);
1165
46.8k
    _mm_storel_epi64((__m128i *)dst, row0);
1166
46.8k
    dst += stride;
1167
46.8k
    _mm_storel_epi64((__m128i *)dst, row1);
1168
46.8k
    dst += stride;
1169
46.8k
    _mm_storel_epi64((__m128i *)dst, row2);
1170
46.8k
    dst += stride;
1171
46.8k
    _mm_storel_epi64((__m128i *)dst, row3);
1172
46.8k
    dst += stride;
1173
1174
46.8k
    row0 = _mm_shufflelo_epi16(left_col_high, 0);
1175
46.8k
    row1 = _mm_shufflelo_epi16(left_col_high, 0x55);
1176
46.8k
    row2 = _mm_shufflelo_epi16(left_col_high, 0xaa);
1177
46.8k
    row3 = _mm_shufflelo_epi16(left_col_high, 0xff);
1178
46.8k
    _mm_storel_epi64((__m128i *)dst, row0);
1179
46.8k
    dst += stride;
1180
46.8k
    _mm_storel_epi64((__m128i *)dst, row1);
1181
46.8k
    dst += stride;
1182
46.8k
    _mm_storel_epi64((__m128i *)dst, row2);
1183
46.8k
    dst += stride;
1184
46.8k
    _mm_storel_epi64((__m128i *)dst, row3);
1185
46.8k
    dst += stride;
1186
1187
46.8k
    left_col_high = _mm_unpackhi_epi64(left_col_high, left_col_high);
1188
46.8k
    row0 = _mm_shufflelo_epi16(left_col_high, 0);
1189
46.8k
    row1 = _mm_shufflelo_epi16(left_col_high, 0x55);
1190
46.8k
    row2 = _mm_shufflelo_epi16(left_col_high, 0xaa);
1191
46.8k
    row3 = _mm_shufflelo_epi16(left_col_high, 0xff);
1192
46.8k
    _mm_storel_epi64((__m128i *)dst, row0);
1193
46.8k
    dst += stride;
1194
46.8k
    _mm_storel_epi64((__m128i *)dst, row1);
1195
46.8k
    dst += stride;
1196
46.8k
    _mm_storel_epi64((__m128i *)dst, row2);
1197
46.8k
    dst += stride;
1198
46.8k
    _mm_storel_epi64((__m128i *)dst, row3);
1199
46.8k
    dst += stride;
1200
46.8k
    left += 16;
1201
46.8k
  }
1202
37.6k
}
1203
1204
void aom_h_predictor_8x16_sse2(uint8_t *dst, ptrdiff_t stride,
1205
28.4k
                               const uint8_t *above, const uint8_t *left) {
1206
28.4k
  h_predictor_8x16xc(dst, stride, above, left, 1);
1207
28.4k
}
1208
1209
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1210
void aom_h_predictor_8x32_sse2(uint8_t *dst, ptrdiff_t stride,
1211
9.22k
                               const uint8_t *above, const uint8_t *left) {
1212
9.22k
  h_predictor_8x16xc(dst, stride, above, left, 2);
1213
9.22k
}
1214
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1215
1216
static inline void h_pred_store_16xh(const __m128i *row, int h, uint8_t *dst,
1217
427k
                                     ptrdiff_t stride) {
1218
427k
  int i;
1219
2.13M
  for (i = 0; i < h; ++i) {
1220
1.71M
    _mm_store_si128((__m128i *)dst, row[i]);
1221
1.71M
    dst += stride;
1222
1.71M
  }
1223
427k
}
1224
1225
470k
static inline void repeat_low_4pixels(const __m128i *x, __m128i *row) {
1226
470k
  const __m128i u0 = _mm_shufflelo_epi16(*x, 0);
1227
470k
  const __m128i u1 = _mm_shufflelo_epi16(*x, 0x55);
1228
470k
  const __m128i u2 = _mm_shufflelo_epi16(*x, 0xaa);
1229
470k
  const __m128i u3 = _mm_shufflelo_epi16(*x, 0xff);
1230
1231
470k
  row[0] = _mm_unpacklo_epi64(u0, u0);
1232
470k
  row[1] = _mm_unpacklo_epi64(u1, u1);
1233
470k
  row[2] = _mm_unpacklo_epi64(u2, u2);
1234
470k
  row[3] = _mm_unpacklo_epi64(u3, u3);
1235
470k
}
1236
1237
365k
static inline void repeat_high_4pixels(const __m128i *x, __m128i *row) {
1238
365k
  const __m128i u0 = _mm_shufflehi_epi16(*x, 0);
1239
365k
  const __m128i u1 = _mm_shufflehi_epi16(*x, 0x55);
1240
365k
  const __m128i u2 = _mm_shufflehi_epi16(*x, 0xaa);
1241
365k
  const __m128i u3 = _mm_shufflehi_epi16(*x, 0xff);
1242
1243
365k
  row[0] = _mm_unpackhi_epi64(u0, u0);
1244
365k
  row[1] = _mm_unpackhi_epi64(u1, u1);
1245
365k
  row[2] = _mm_unpackhi_epi64(u2, u2);
1246
365k
  row[3] = _mm_unpackhi_epi64(u3, u3);
1247
365k
}
1248
1249
// Process 16x8, first 4 rows
1250
// Use first 8 bytes of left register: xxxxxxxx33221100
1251
static inline void h_prediction_16x8_1(const __m128i *left, uint8_t *dst,
1252
266k
                                       ptrdiff_t stride) {
1253
266k
  __m128i row[4];
1254
266k
  repeat_low_4pixels(left, row);
1255
266k
  h_pred_store_16xh(row, 4, dst, stride);
1256
266k
}
1257
1258
// Process 16x8, second 4 rows
1259
// Use second 8 bytes of left register: 77665544xxxxxxxx
1260
static inline void h_prediction_16x8_2(const __m128i *left, uint8_t *dst,
1261
161k
                                       ptrdiff_t stride) {
1262
161k
  __m128i row[4];
1263
161k
  repeat_high_4pixels(left, row);
1264
161k
  h_pred_store_16xh(row, 4, dst, stride);
1265
161k
}
1266
1267
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1268
void aom_h_predictor_16x4_sse2(uint8_t *dst, ptrdiff_t stride,
1269
104k
                               const uint8_t *above, const uint8_t *left) {
1270
104k
  (void)above;
1271
104k
  const __m128i left_col = _mm_loadl_epi64((const __m128i *)left);
1272
104k
  const __m128i left_col_8p = _mm_unpacklo_epi8(left_col, left_col);
1273
104k
  h_prediction_16x8_1(&left_col_8p, dst, stride);
1274
104k
}
1275
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1276
1277
void aom_h_predictor_16x8_sse2(uint8_t *dst, ptrdiff_t stride,
1278
62.8k
                               const uint8_t *above, const uint8_t *left) {
1279
62.8k
  (void)above;
1280
62.8k
  const __m128i left_col = _mm_loadl_epi64((const __m128i *)left);
1281
62.8k
  const __m128i left_col_8p = _mm_unpacklo_epi8(left_col, left_col);
1282
62.8k
  h_prediction_16x8_1(&left_col_8p, dst, stride);
1283
62.8k
  dst += stride << 2;
1284
62.8k
  h_prediction_16x8_2(&left_col_8p, dst, stride);
1285
62.8k
}
1286
1287
static inline void h_predictor_16xh(uint8_t *dst, ptrdiff_t stride,
1288
22.2k
                                    const uint8_t *left, int count) {
1289
22.2k
  int i = 0;
1290
49.4k
  do {
1291
49.4k
    const __m128i left_col = _mm_load_si128((const __m128i *)left);
1292
49.4k
    const __m128i left_col_8p_lo = _mm_unpacklo_epi8(left_col, left_col);
1293
49.4k
    h_prediction_16x8_1(&left_col_8p_lo, dst, stride);
1294
49.4k
    dst += stride << 2;
1295
49.4k
    h_prediction_16x8_2(&left_col_8p_lo, dst, stride);
1296
49.4k
    dst += stride << 2;
1297
1298
49.4k
    const __m128i left_col_8p_hi = _mm_unpackhi_epi8(left_col, left_col);
1299
49.4k
    h_prediction_16x8_1(&left_col_8p_hi, dst, stride);
1300
49.4k
    dst += stride << 2;
1301
49.4k
    h_prediction_16x8_2(&left_col_8p_hi, dst, stride);
1302
49.4k
    dst += stride << 2;
1303
1304
49.4k
    left += 16;
1305
49.4k
    i++;
1306
49.4k
  } while (i < count);
1307
22.2k
}
1308
1309
void aom_h_predictor_16x32_sse2(uint8_t *dst, ptrdiff_t stride,
1310
19.7k
                                const uint8_t *above, const uint8_t *left) {
1311
19.7k
  (void)above;
1312
19.7k
  h_predictor_16xh(dst, stride, left, 2);
1313
19.7k
}
1314
1315
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1316
void aom_h_predictor_16x64_sse2(uint8_t *dst, ptrdiff_t stride,
1317
2.46k
                                const uint8_t *above, const uint8_t *left) {
1318
2.46k
  (void)above;
1319
2.46k
  h_predictor_16xh(dst, stride, left, 4);
1320
2.46k
}
1321
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1322
1323
static inline void h_pred_store_32xh(const __m128i *row, int h, uint8_t *dst,
1324
408k
                                     ptrdiff_t stride) {
1325
408k
  int i;
1326
2.04M
  for (i = 0; i < h; ++i) {
1327
1.63M
    _mm_store_si128((__m128i *)dst, row[i]);
1328
1.63M
    _mm_store_si128((__m128i *)(dst + 16), row[i]);
1329
1.63M
    dst += stride;
1330
1.63M
  }
1331
408k
}
1332
1333
// Process 32x8, first 4 rows
1334
// Use first 8 bytes of left register: xxxxxxxx33221100
1335
static inline void h_prediction_32x8_1(const __m128i *left, uint8_t *dst,
1336
204k
                                       ptrdiff_t stride) {
1337
204k
  __m128i row[4];
1338
204k
  repeat_low_4pixels(left, row);
1339
204k
  h_pred_store_32xh(row, 4, dst, stride);
1340
204k
}
1341
1342
// Process 32x8, second 4 rows
1343
// Use second 8 bytes of left register: 77665544xxxxxxxx
1344
static inline void h_prediction_32x8_2(const __m128i *left, uint8_t *dst,
1345
204k
                                       ptrdiff_t stride) {
1346
204k
  __m128i row[4];
1347
204k
  repeat_high_4pixels(left, row);
1348
204k
  h_pred_store_32xh(row, 4, dst, stride);
1349
204k
}
1350
1351
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1352
void aom_h_predictor_32x8_sse2(uint8_t *dst, ptrdiff_t stride,
1353
125k
                               const uint8_t *above, const uint8_t *left) {
1354
125k
  __m128i left_col, left_col_8p;
1355
125k
  (void)above;
1356
1357
125k
  left_col = _mm_load_si128((const __m128i *)left);
1358
1359
125k
  left_col_8p = _mm_unpacklo_epi8(left_col, left_col);
1360
125k
  h_prediction_32x8_1(&left_col_8p, dst, stride);
1361
125k
  dst += stride << 2;
1362
125k
  h_prediction_32x8_2(&left_col_8p, dst, stride);
1363
125k
}
1364
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1365
1366
void aom_h_predictor_32x16_sse2(uint8_t *dst, ptrdiff_t stride,
1367
39.5k
                                const uint8_t *above, const uint8_t *left) {
1368
39.5k
  __m128i left_col, left_col_8p;
1369
39.5k
  (void)above;
1370
1371
39.5k
  left_col = _mm_load_si128((const __m128i *)left);
1372
1373
39.5k
  left_col_8p = _mm_unpacklo_epi8(left_col, left_col);
1374
39.5k
  h_prediction_32x8_1(&left_col_8p, dst, stride);
1375
39.5k
  dst += stride << 2;
1376
39.5k
  h_prediction_32x8_2(&left_col_8p, dst, stride);
1377
39.5k
  dst += stride << 2;
1378
1379
39.5k
  left_col_8p = _mm_unpackhi_epi8(left_col, left_col);
1380
39.5k
  h_prediction_32x8_1(&left_col_8p, dst, stride);
1381
39.5k
  dst += stride << 2;
1382
39.5k
  h_prediction_32x8_2(&left_col_8p, dst, stride);
1383
39.5k
}
1384
1385
static inline void h_predictor_32xh(uint8_t *dst, ptrdiff_t stride,
1386
2.44k
                                    const uint8_t *left, int height) {
1387
2.44k
  int i = height >> 2;
1388
39.0k
  do {
1389
39.0k
    __m128i left4 = _mm_cvtsi32_si128(((int *)left)[0]);
1390
39.0k
    left4 = _mm_unpacklo_epi8(left4, left4);
1391
39.0k
    left4 = _mm_unpacklo_epi8(left4, left4);
1392
39.0k
    const __m128i r0 = _mm_shuffle_epi32(left4, 0x0);
1393
39.0k
    const __m128i r1 = _mm_shuffle_epi32(left4, 0x55);
1394
39.0k
    _mm_store_si128((__m128i *)dst, r0);
1395
39.0k
    _mm_store_si128((__m128i *)(dst + 16), r0);
1396
39.0k
    _mm_store_si128((__m128i *)(dst + stride), r1);
1397
39.0k
    _mm_store_si128((__m128i *)(dst + stride + 16), r1);
1398
39.0k
    const __m128i r2 = _mm_shuffle_epi32(left4, 0xaa);
1399
39.0k
    const __m128i r3 = _mm_shuffle_epi32(left4, 0xff);
1400
39.0k
    _mm_store_si128((__m128i *)(dst + stride * 2), r2);
1401
39.0k
    _mm_store_si128((__m128i *)(dst + stride * 2 + 16), r2);
1402
39.0k
    _mm_store_si128((__m128i *)(dst + stride * 3), r3);
1403
39.0k
    _mm_store_si128((__m128i *)(dst + stride * 3 + 16), r3);
1404
39.0k
    left += 4;
1405
39.0k
    dst += stride * 4;
1406
39.0k
  } while (--i);
1407
2.44k
}
1408
1409
void aom_h_predictor_32x64_sse2(uint8_t *dst, ptrdiff_t stride,
1410
2.44k
                                const uint8_t *above, const uint8_t *left) {
1411
2.44k
  (void)above;
1412
2.44k
  h_predictor_32xh(dst, stride, left, 64);
1413
2.44k
}
1414
1415
static inline void h_predictor_64xh(uint8_t *dst, ptrdiff_t stride,
1416
62.3k
                                    const uint8_t *left, int height) {
1417
62.3k
  int i = height >> 2;
1418
443k
  do {
1419
443k
    __m128i left4 = _mm_cvtsi32_si128(((int *)left)[0]);
1420
443k
    left4 = _mm_unpacklo_epi8(left4, left4);
1421
443k
    left4 = _mm_unpacklo_epi8(left4, left4);
1422
443k
    const __m128i r0 = _mm_shuffle_epi32(left4, 0x0);
1423
443k
    const __m128i r1 = _mm_shuffle_epi32(left4, 0x55);
1424
443k
    _mm_store_si128((__m128i *)dst, r0);
1425
443k
    _mm_store_si128((__m128i *)(dst + 16), r0);
1426
443k
    _mm_store_si128((__m128i *)(dst + 32), r0);
1427
443k
    _mm_store_si128((__m128i *)(dst + 48), r0);
1428
443k
    _mm_store_si128((__m128i *)(dst + stride), r1);
1429
443k
    _mm_store_si128((__m128i *)(dst + stride + 16), r1);
1430
443k
    _mm_store_si128((__m128i *)(dst + stride + 32), r1);
1431
443k
    _mm_store_si128((__m128i *)(dst + stride + 48), r1);
1432
443k
    const __m128i r2 = _mm_shuffle_epi32(left4, 0xaa);
1433
443k
    const __m128i r3 = _mm_shuffle_epi32(left4, 0xff);
1434
443k
    _mm_store_si128((__m128i *)(dst + stride * 2), r2);
1435
443k
    _mm_store_si128((__m128i *)(dst + stride * 2 + 16), r2);
1436
443k
    _mm_store_si128((__m128i *)(dst + stride * 2 + 32), r2);
1437
443k
    _mm_store_si128((__m128i *)(dst + stride * 2 + 48), r2);
1438
443k
    _mm_store_si128((__m128i *)(dst + stride * 3), r3);
1439
443k
    _mm_store_si128((__m128i *)(dst + stride * 3 + 16), r3);
1440
443k
    _mm_store_si128((__m128i *)(dst + stride * 3 + 32), r3);
1441
443k
    _mm_store_si128((__m128i *)(dst + stride * 3 + 48), r3);
1442
443k
    left += 4;
1443
443k
    dst += stride * 4;
1444
443k
  } while (--i);
1445
62.3k
}
1446
1447
void aom_h_predictor_64x64_sse2(uint8_t *dst, ptrdiff_t stride,
1448
13.4k
                                const uint8_t *above, const uint8_t *left) {
1449
13.4k
  (void)above;
1450
13.4k
  h_predictor_64xh(dst, stride, left, 64);
1451
13.4k
}
1452
1453
void aom_h_predictor_64x32_sse2(uint8_t *dst, ptrdiff_t stride,
1454
8.37k
                                const uint8_t *above, const uint8_t *left) {
1455
8.37k
  (void)above;
1456
8.37k
  h_predictor_64xh(dst, stride, left, 32);
1457
8.37k
}
1458
1459
#if !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER
1460
void aom_h_predictor_64x16_sse2(uint8_t *dst, ptrdiff_t stride,
1461
40.5k
                                const uint8_t *above, const uint8_t *left) {
1462
40.5k
  (void)above;
1463
40.5k
  h_predictor_64xh(dst, stride, left, 16);
1464
40.5k
}
1465
#endif  // !CONFIG_REALTIME_ONLY || CONFIG_AV1_DECODER