/src/libvpx/vp8/decoder/threading.c
Line | Count | Source |
1 | | /* |
2 | | * Copyright (c) 2010 The WebM project authors. All Rights Reserved. |
3 | | * |
4 | | * Use of this source code is governed by a BSD-style license |
5 | | * that can be found in the LICENSE file in the root of the source |
6 | | * tree. An additional intellectual property rights grant can be found |
7 | | * in the file PATENTS. All contributing project authors may |
8 | | * be found in the AUTHORS file in the root of the source tree. |
9 | | */ |
10 | | |
11 | | #include "vpx_config.h" |
12 | | #include "vp8_rtcd.h" |
13 | | #if !defined(_WIN32) && CONFIG_OS_SUPPORT == 1 |
14 | | #include <unistd.h> |
15 | | #endif |
16 | | #include "onyxd_int.h" |
17 | | #include "vpx_mem/vpx_mem.h" |
18 | | #include "vpx_util/vpx_pthread.h" |
19 | | #include "vp8/common/common.h" |
20 | | #include "vp8/common/threading.h" |
21 | | #include "vp8/common/loopfilter.h" |
22 | | #include "vp8/common/extend.h" |
23 | | #include "vpx_ports/vpx_timer.h" |
24 | | #include "decoderthreading.h" |
25 | | #include "detokenize.h" |
26 | | #include "vp8/common/reconintra4x4.h" |
27 | | #include "vp8/common/reconinter.h" |
28 | | #include "vp8/common/reconintra.h" |
29 | | #include "vp8/common/setupintrarecon.h" |
30 | | #if CONFIG_ERROR_CONCEALMENT |
31 | | #include "error_concealment.h" |
32 | | #endif |
33 | | |
34 | | #define CALLOC_ARRAY(p, n) \ |
35 | 311k | CHECK_MEM_ERROR(&pbi->common.error, (p), vpx_calloc(sizeof(*(p)), (n))) |
36 | | #define CALLOC_ARRAY_ALIGNED(p, n, algn) \ |
37 | 25.5k | do { \ |
38 | 25.5k | CHECK_MEM_ERROR(&pbi->common.error, (p), \ |
39 | 25.5k | vpx_memalign((algn), sizeof(*(p)) * (n))); \ |
40 | 25.5k | memset((p), 0, (n) * sizeof(*(p))); \ |
41 | 25.5k | } while (0) |
42 | | |
43 | | static void setup_decoding_thread_data(VP8D_COMP *pbi, MACROBLOCKD *xd, |
44 | 13.2k | MB_ROW_DEC *mbrd, int count) { |
45 | 13.2k | VP8_COMMON *const pc = &pbi->common; |
46 | 13.2k | int i; |
47 | | |
48 | 26.9k | for (i = 0; i < count; ++i) { |
49 | 13.7k | MACROBLOCKD *mbd = &mbrd[i].mbd; |
50 | | |
51 | | // The worker MACROBLOCKDs persist across frames, so reset the per-frame |
52 | | // error state in line with the main thread (see vp8_decode_frame()). |
53 | | // This should only be done for keyframes or when error concealment |
54 | | // is active. |
55 | 13.7k | if (pc->frame_type == KEY_FRAME || pbi->ec_active) { |
56 | 12.3k | mbd->corrupted = 0; |
57 | 12.3k | } |
58 | | |
59 | 13.7k | mbd->subpixel_predict = xd->subpixel_predict; |
60 | 13.7k | mbd->subpixel_predict8x4 = xd->subpixel_predict8x4; |
61 | 13.7k | mbd->subpixel_predict8x8 = xd->subpixel_predict8x8; |
62 | 13.7k | mbd->subpixel_predict16x16 = xd->subpixel_predict16x16; |
63 | | |
64 | 13.7k | mbd->frame_type = pc->frame_type; |
65 | 13.7k | mbd->pre = xd->pre; |
66 | 13.7k | mbd->dst = xd->dst; |
67 | | |
68 | 13.7k | mbd->segmentation_enabled = xd->segmentation_enabled; |
69 | 13.7k | mbd->mb_segment_abs_delta = xd->mb_segment_abs_delta; |
70 | 13.7k | memcpy(mbd->segment_feature_data, xd->segment_feature_data, |
71 | 13.7k | sizeof(xd->segment_feature_data)); |
72 | | |
73 | | /*signed char ref_lf_deltas[MAX_REF_LF_DELTAS];*/ |
74 | 13.7k | memcpy(mbd->ref_lf_deltas, xd->ref_lf_deltas, sizeof(xd->ref_lf_deltas)); |
75 | | /*signed char mode_lf_deltas[MAX_MODE_LF_DELTAS];*/ |
76 | 13.7k | memcpy(mbd->mode_lf_deltas, xd->mode_lf_deltas, sizeof(xd->mode_lf_deltas)); |
77 | | /*unsigned char mode_ref_lf_delta_enabled; |
78 | | unsigned char mode_ref_lf_delta_update;*/ |
79 | 13.7k | mbd->mode_ref_lf_delta_enabled = xd->mode_ref_lf_delta_enabled; |
80 | 13.7k | mbd->mode_ref_lf_delta_update = xd->mode_ref_lf_delta_update; |
81 | | |
82 | 13.7k | mbd->current_bc = &pbi->mbc[0]; |
83 | | |
84 | 13.7k | memcpy(mbd->dequant_y1_dc, xd->dequant_y1_dc, sizeof(xd->dequant_y1_dc)); |
85 | 13.7k | memcpy(mbd->dequant_y1, xd->dequant_y1, sizeof(xd->dequant_y1)); |
86 | 13.7k | memcpy(mbd->dequant_y2, xd->dequant_y2, sizeof(xd->dequant_y2)); |
87 | 13.7k | memcpy(mbd->dequant_uv, xd->dequant_uv, sizeof(xd->dequant_uv)); |
88 | | |
89 | 13.7k | mbd->fullpixel_mask = ~0; |
90 | | |
91 | 13.7k | if (pc->full_pixel) mbd->fullpixel_mask = ~7; |
92 | 13.7k | } |
93 | | |
94 | 2.09M | for (i = 0; i < pc->mb_rows; ++i) |
95 | 2.08M | vpx_atomic_store_release(&pbi->mt_current_mb_col[i], -1); |
96 | 13.2k | } |
97 | | |
98 | | static void mt_decode_macroblock(VP8D_COMP *pbi, MACROBLOCKD *xd, |
99 | 2.06M | unsigned int mb_idx) { |
100 | 2.06M | MB_PREDICTION_MODE mode; |
101 | 2.06M | int i; |
102 | | #if CONFIG_ERROR_CONCEALMENT |
103 | | int corruption_detected = 0; |
104 | | #else |
105 | 2.06M | (void)mb_idx; |
106 | 2.06M | #endif |
107 | | |
108 | 2.06M | if (xd->mode_info_context->mbmi.mb_skip_coeff) { |
109 | 1.47M | vp8_reset_mb_tokens_context(xd); |
110 | 1.47M | } else if (!vp8dx_bool_error(xd->current_bc)) { |
111 | 587k | int eobtotal; |
112 | 587k | eobtotal = vp8_decode_mb_tokens(pbi, xd); |
113 | | |
114 | | /* Special case: Force the loopfilter to skip when eobtotal is zero */ |
115 | 587k | xd->mode_info_context->mbmi.mb_skip_coeff = (eobtotal == 0); |
116 | 587k | } |
117 | | |
118 | 2.06M | mode = xd->mode_info_context->mbmi.mode; |
119 | | |
120 | 2.06M | if (xd->segmentation_enabled) vp8_mb_init_dequantizer(pbi, xd); |
121 | | |
122 | | #if CONFIG_ERROR_CONCEALMENT |
123 | | |
124 | | if (pbi->ec_active) { |
125 | | int throw_residual; |
126 | | /* When we have independent partitions we can apply residual even |
127 | | * though other partitions within the frame are corrupt. |
128 | | */ |
129 | | throw_residual = |
130 | | (!pbi->independent_partitions && pbi->frame_corrupt_residual); |
131 | | throw_residual = (throw_residual || vp8dx_bool_error(xd->current_bc)); |
132 | | |
133 | | if ((mb_idx >= pbi->mvs_corrupt_from_mb || throw_residual)) { |
134 | | /* MB with corrupt residuals or corrupt mode/motion vectors. |
135 | | * Better to use the predictor as reconstruction. |
136 | | */ |
137 | | pbi->frame_corrupt_residual = 1; |
138 | | memset(xd->qcoeff, 0, sizeof(xd->qcoeff)); |
139 | | |
140 | | corruption_detected = 1; |
141 | | |
142 | | /* force idct to be skipped for B_PRED and use the |
143 | | * prediction only for reconstruction |
144 | | * */ |
145 | | memset(xd->eobs, 0, 25); |
146 | | } |
147 | | } |
148 | | #endif |
149 | | |
150 | | /* do prediction */ |
151 | 2.06M | if (xd->mode_info_context->mbmi.ref_frame == INTRA_FRAME) { |
152 | 1.32M | vp8_build_intra_predictors_mbuv_s( |
153 | 1.32M | xd, xd->recon_above[1], xd->recon_above[2], xd->recon_left[1], |
154 | 1.32M | xd->recon_left[2], xd->recon_left_stride[1], xd->dst.u_buffer, |
155 | 1.32M | xd->dst.v_buffer, xd->dst.uv_stride); |
156 | | |
157 | 1.32M | if (mode != B_PRED) { |
158 | 780k | vp8_build_intra_predictors_mby_s( |
159 | 780k | xd, xd->recon_above[0], xd->recon_left[0], xd->recon_left_stride[0], |
160 | 780k | xd->dst.y_buffer, xd->dst.y_stride); |
161 | 780k | } else { |
162 | 544k | short *DQC = xd->dequant_y1; |
163 | 544k | int dst_stride = xd->dst.y_stride; |
164 | | |
165 | | /* clear out residual eob info */ |
166 | 544k | if (xd->mode_info_context->mbmi.mb_skip_coeff) memset(xd->eobs, 0, 25); |
167 | | |
168 | 544k | intra_prediction_down_copy(xd, xd->recon_above[0] + 16); |
169 | | |
170 | 9.12M | for (i = 0; i < 16; ++i) { |
171 | 8.57M | BLOCKD *b = &xd->block[i]; |
172 | 8.57M | unsigned char *dst = xd->dst.y_buffer + b->offset; |
173 | 8.57M | B_PREDICTION_MODE b_mode = xd->mode_info_context->bmi[i].as_mode; |
174 | 8.57M | unsigned char *Above; |
175 | 8.57M | unsigned char *yleft; |
176 | 8.57M | int left_stride; |
177 | 8.57M | unsigned char top_left; |
178 | | |
179 | | /*Caution: For some b_mode, it needs 8 pixels (4 above + 4 |
180 | | * above-right).*/ |
181 | 8.57M | if (i < 4 && pbi->common.filter_level) { |
182 | 2.07M | Above = xd->recon_above[0] + b->offset; |
183 | 6.49M | } else { |
184 | 6.49M | Above = dst - dst_stride; |
185 | 6.49M | } |
186 | | |
187 | 8.57M | if (i % 4 == 0 && pbi->common.filter_level) { |
188 | 2.08M | yleft = xd->recon_left[0] + i; |
189 | 2.08M | left_stride = 1; |
190 | 6.49M | } else { |
191 | 6.49M | yleft = dst - 1; |
192 | 6.49M | left_stride = dst_stride; |
193 | 6.49M | } |
194 | | |
195 | 8.57M | if ((i == 4 || i == 8 || i == 12) && pbi->common.filter_level) { |
196 | 1.56M | top_left = *(xd->recon_left[0] + i - 1); |
197 | 7.00M | } else { |
198 | 7.00M | top_left = Above[-1]; |
199 | 7.00M | } |
200 | | |
201 | 8.57M | vp8_intra4x4_predict(Above, yleft, left_stride, b_mode, dst, dst_stride, |
202 | 8.57M | top_left); |
203 | | |
204 | 8.57M | if (xd->eobs[i]) { |
205 | 706k | if (xd->eobs[i] > 1) { |
206 | 398k | vp8_dequant_idct_add(b->qcoeff, DQC, dst, dst_stride); |
207 | 398k | } else { |
208 | 307k | vp8_dc_only_idct_add(b->qcoeff[0] * DQC[0], dst, dst_stride, dst, |
209 | 307k | dst_stride); |
210 | 307k | memset(b->qcoeff, 0, 2 * sizeof(b->qcoeff[0])); |
211 | 307k | } |
212 | 706k | } |
213 | 8.57M | } |
214 | 544k | } |
215 | 1.32M | } else { |
216 | 738k | vp8_build_inter_predictors_mb(xd); |
217 | 738k | } |
218 | | |
219 | | #if CONFIG_ERROR_CONCEALMENT |
220 | | if (corruption_detected) { |
221 | | return; |
222 | | } |
223 | | #endif |
224 | | |
225 | 2.06M | if (!xd->mode_info_context->mbmi.mb_skip_coeff) { |
226 | | /* dequantization and idct */ |
227 | 206k | if (mode != B_PRED) { |
228 | 91.9k | short *DQC = xd->dequant_y1; |
229 | | |
230 | 91.9k | if (mode != SPLITMV) { |
231 | 88.2k | BLOCKD *b = &xd->block[24]; |
232 | | |
233 | | /* do 2nd order transform on the dc block */ |
234 | 88.2k | if (xd->eobs[24] > 1) { |
235 | 42.5k | vp8_dequantize_b(b, xd->dequant_y2); |
236 | | |
237 | 42.5k | vp8_short_inv_walsh4x4(&b->dqcoeff[0], xd->qcoeff); |
238 | 42.5k | memset(b->qcoeff, 0, 16 * sizeof(b->qcoeff[0])); |
239 | 45.7k | } else { |
240 | 45.7k | b->dqcoeff[0] = (short)(b->qcoeff[0] * xd->dequant_y2[0]); |
241 | 45.7k | vp8_short_inv_walsh4x4_1(&b->dqcoeff[0], xd->qcoeff); |
242 | 45.7k | memset(b->qcoeff, 0, 2 * sizeof(b->qcoeff[0])); |
243 | 45.7k | } |
244 | | |
245 | | /* override the dc dequant constant in order to preserve the |
246 | | * dc components |
247 | | */ |
248 | 88.2k | DQC = xd->dequant_y1_dc; |
249 | 88.2k | } |
250 | | |
251 | 91.9k | vp8_dequant_idct_add_y_block(xd->qcoeff, DQC, xd->dst.y_buffer, |
252 | 91.9k | xd->dst.y_stride, xd->eobs); |
253 | 91.9k | } |
254 | | |
255 | 206k | vp8_dequant_idct_add_uv_block(xd->qcoeff + 16 * 16, xd->dequant_uv, |
256 | 206k | xd->dst.u_buffer, xd->dst.v_buffer, |
257 | 206k | xd->dst.uv_stride, xd->eobs + 16); |
258 | 206k | } |
259 | 2.06M | } |
260 | | |
261 | | static void mt_decode_mb_rows(VP8D_COMP *pbi, MACROBLOCKD *xd, |
262 | 26.9k | int start_mb_row) { |
263 | 26.9k | const vpx_atomic_int *last_row_current_mb_col; |
264 | 26.9k | vpx_atomic_int *current_mb_col; |
265 | 26.9k | int mb_row; |
266 | 26.9k | VP8_COMMON *pc = &pbi->common; |
267 | 26.9k | const int nsync = pbi->sync_range; |
268 | 26.9k | const vpx_atomic_int first_row_no_sync_above = |
269 | 26.9k | VPX_ATOMIC_INIT(pc->mb_cols + nsync); |
270 | 26.9k | int num_part = 1 << pbi->common.multi_token_partition; |
271 | 26.9k | int last_mb_row = start_mb_row; |
272 | | |
273 | 26.9k | YV12_BUFFER_CONFIG *yv12_fb_new = pbi->dec_fb_ref[INTRA_FRAME]; |
274 | 26.9k | YV12_BUFFER_CONFIG *yv12_fb_lst = pbi->dec_fb_ref[LAST_FRAME]; |
275 | | |
276 | 26.9k | int recon_y_stride = yv12_fb_new->y_stride; |
277 | 26.9k | int recon_uv_stride = yv12_fb_new->uv_stride; |
278 | | |
279 | 26.9k | unsigned char *ref_buffer[MAX_REF_FRAMES][3]; |
280 | 26.9k | unsigned char *dst_buffer[3]; |
281 | 26.9k | int i; |
282 | 26.9k | int ref_fb_corrupted[MAX_REF_FRAMES]; |
283 | | |
284 | 26.9k | ref_fb_corrupted[INTRA_FRAME] = 0; |
285 | | |
286 | 107k | for (i = 1; i < MAX_REF_FRAMES; ++i) { |
287 | 80.8k | YV12_BUFFER_CONFIG *this_fb = pbi->dec_fb_ref[i]; |
288 | | |
289 | 80.8k | ref_buffer[i][0] = this_fb->y_buffer; |
290 | 80.8k | ref_buffer[i][1] = this_fb->u_buffer; |
291 | 80.8k | ref_buffer[i][2] = this_fb->v_buffer; |
292 | | |
293 | 80.8k | ref_fb_corrupted[i] = this_fb->corrupted; |
294 | 80.8k | } |
295 | | |
296 | 26.9k | dst_buffer[0] = yv12_fb_new->y_buffer; |
297 | 26.9k | dst_buffer[1] = yv12_fb_new->u_buffer; |
298 | 26.9k | dst_buffer[2] = yv12_fb_new->v_buffer; |
299 | | |
300 | 26.9k | xd->up_available = (start_mb_row != 0); |
301 | | |
302 | 26.9k | xd->mode_info_context = pc->mi + pc->mode_info_stride * start_mb_row; |
303 | 26.9k | xd->mode_info_stride = pc->mode_info_stride; |
304 | | |
305 | 97.7k | for (mb_row = start_mb_row; mb_row < pc->mb_rows; |
306 | 70.8k | mb_row += (pbi->decoding_thread_count + 1)) { |
307 | 70.8k | int recon_yoffset, recon_uvoffset; |
308 | 70.8k | int mb_col; |
309 | 70.8k | int filter_level; |
310 | 70.8k | loop_filter_info_n *lfi_n = &pc->lf_info; |
311 | | |
312 | | /* save last row processed by this thread */ |
313 | 70.8k | last_mb_row = mb_row; |
314 | | /* select bool coder for current partition */ |
315 | 70.8k | xd->current_bc = &pbi->mbc[mb_row % num_part]; |
316 | | |
317 | 70.8k | if (mb_row > 0) { |
318 | 57.6k | last_row_current_mb_col = &pbi->mt_current_mb_col[mb_row - 1]; |
319 | 57.6k | } else { |
320 | 13.2k | last_row_current_mb_col = &first_row_no_sync_above; |
321 | 13.2k | } |
322 | | |
323 | 70.8k | current_mb_col = &pbi->mt_current_mb_col[mb_row]; |
324 | | |
325 | 70.8k | recon_yoffset = mb_row * recon_y_stride * 16; |
326 | 70.8k | recon_uvoffset = mb_row * recon_uv_stride * 8; |
327 | | |
328 | | /* reset contexts */ |
329 | 70.8k | xd->above_context = pc->above_context; |
330 | 70.8k | memset(xd->left_context, 0, sizeof(ENTROPY_CONTEXT_PLANES)); |
331 | | |
332 | 70.8k | xd->left_available = 0; |
333 | | |
334 | 70.8k | xd->mb_to_top_edge = -((mb_row * 16) << 3); |
335 | 70.8k | xd->mb_to_bottom_edge = ((pc->mb_rows - 1 - mb_row) * 16) << 3; |
336 | | |
337 | 70.8k | if (pbi->common.filter_level) { |
338 | 67.6k | xd->recon_above[0] = pbi->mt_yabove_row[mb_row] + 0 * 16 + 32; |
339 | 67.6k | xd->recon_above[1] = pbi->mt_uabove_row[mb_row] + 0 * 8 + 16; |
340 | 67.6k | xd->recon_above[2] = pbi->mt_vabove_row[mb_row] + 0 * 8 + 16; |
341 | | |
342 | 67.6k | xd->recon_left[0] = pbi->mt_yleft_col[mb_row]; |
343 | 67.6k | xd->recon_left[1] = pbi->mt_uleft_col[mb_row]; |
344 | 67.6k | xd->recon_left[2] = pbi->mt_vleft_col[mb_row]; |
345 | | |
346 | | /* TODO: move to outside row loop */ |
347 | 67.6k | xd->recon_left_stride[0] = 1; |
348 | 67.6k | xd->recon_left_stride[1] = 1; |
349 | 67.6k | } else { |
350 | 3.16k | xd->recon_above[0] = dst_buffer[0] + recon_yoffset; |
351 | 3.16k | xd->recon_above[1] = dst_buffer[1] + recon_uvoffset; |
352 | 3.16k | xd->recon_above[2] = dst_buffer[2] + recon_uvoffset; |
353 | | |
354 | 3.16k | xd->recon_left[0] = xd->recon_above[0] - 1; |
355 | 3.16k | xd->recon_left[1] = xd->recon_above[1] - 1; |
356 | 3.16k | xd->recon_left[2] = xd->recon_above[2] - 1; |
357 | | |
358 | 3.16k | xd->recon_above[0] -= xd->dst.y_stride; |
359 | 3.16k | xd->recon_above[1] -= xd->dst.uv_stride; |
360 | 3.16k | xd->recon_above[2] -= xd->dst.uv_stride; |
361 | | |
362 | | /* TODO: move to outside row loop */ |
363 | 3.16k | xd->recon_left_stride[0] = xd->dst.y_stride; |
364 | 3.16k | xd->recon_left_stride[1] = xd->dst.uv_stride; |
365 | | |
366 | 3.16k | setup_intra_recon_left(xd->recon_left[0], xd->recon_left[1], |
367 | 3.16k | xd->recon_left[2], xd->dst.y_stride, |
368 | 3.16k | xd->dst.uv_stride); |
369 | 3.16k | } |
370 | | |
371 | 2.28M | for (mb_col = 0; mb_col < pc->mb_cols; ++mb_col) { |
372 | 2.21M | if (((mb_col - 1) % nsync) == 0) { |
373 | 447k | vpx_atomic_store_release(current_mb_col, mb_col - 1); |
374 | 447k | } |
375 | | |
376 | 2.21M | if (mb_row && !(mb_col & (nsync - 1))) { |
377 | 396k | vp8_atomic_spin_wait(mb_col, last_row_current_mb_col, nsync); |
378 | 396k | } |
379 | | |
380 | | /* Distance of MB to the various image edges. |
381 | | * These are specified to 8th pel as they are always |
382 | | * compared to values that are in 1/8th pel units. |
383 | | */ |
384 | 2.21M | xd->mb_to_left_edge = -((mb_col * 16) << 3); |
385 | 2.21M | xd->mb_to_right_edge = ((pc->mb_cols - 1 - mb_col) * 16) << 3; |
386 | | |
387 | | #if CONFIG_ERROR_CONCEALMENT |
388 | | { |
389 | | int corrupt_residual = |
390 | | (!pbi->independent_partitions && pbi->frame_corrupt_residual) || |
391 | | vp8dx_bool_error(xd->current_bc); |
392 | | if (pbi->ec_active && |
393 | | (xd->mode_info_context->mbmi.ref_frame == INTRA_FRAME) && |
394 | | corrupt_residual) { |
395 | | /* We have an intra block with corrupt |
396 | | * coefficients, better to conceal with an inter |
397 | | * block. |
398 | | * Interpolate MVs from neighboring MBs |
399 | | * |
400 | | * Note that for the first mb with corrupt |
401 | | * residual in a frame, we might not discover |
402 | | * that before decoding the residual. That |
403 | | * happens after this check, and therefore no |
404 | | * inter concealment will be done. |
405 | | */ |
406 | | vp8_interpolate_motion(xd, mb_row, mb_col, pc->mb_rows, pc->mb_cols); |
407 | | } |
408 | | } |
409 | | #endif |
410 | | |
411 | 2.21M | xd->dst.y_buffer = dst_buffer[0] + recon_yoffset; |
412 | 2.21M | xd->dst.u_buffer = dst_buffer[1] + recon_uvoffset; |
413 | 2.21M | xd->dst.v_buffer = dst_buffer[2] + recon_uvoffset; |
414 | | |
415 | | /* propagate errors from reference frames */ |
416 | 2.21M | xd->corrupted |= ref_fb_corrupted[xd->mode_info_context->mbmi.ref_frame]; |
417 | | |
418 | 2.21M | if (xd->corrupted) { |
419 | | // Move current decoding marcoblock to the end of row for all rows |
420 | | // assigned to this thread, such that other threads won't be waiting. |
421 | 2.03M | for (; mb_row < pc->mb_rows; |
422 | 2.01M | mb_row += (pbi->decoding_thread_count + 1)) { |
423 | 2.01M | current_mb_col = &pbi->mt_current_mb_col[mb_row]; |
424 | 2.01M | vpx_atomic_store_release(current_mb_col, pc->mb_cols + nsync); |
425 | 2.01M | } |
426 | 19.4k | vpx_internal_error(&xd->error_info, VPX_CODEC_CORRUPT_FRAME, |
427 | 19.4k | "Corrupted reference frame"); |
428 | 19.4k | } |
429 | | |
430 | 2.21M | if (xd->mode_info_context->mbmi.ref_frame >= LAST_FRAME) { |
431 | 787k | const MV_REFERENCE_FRAME ref = xd->mode_info_context->mbmi.ref_frame; |
432 | 787k | xd->pre.y_buffer = ref_buffer[ref][0] + recon_yoffset; |
433 | 787k | xd->pre.u_buffer = ref_buffer[ref][1] + recon_uvoffset; |
434 | 787k | xd->pre.v_buffer = ref_buffer[ref][2] + recon_uvoffset; |
435 | 1.42M | } else { |
436 | | // ref_frame is INTRA_FRAME, pre buffer should not be used. |
437 | 1.42M | xd->pre.y_buffer = 0; |
438 | 1.42M | xd->pre.u_buffer = 0; |
439 | 1.42M | xd->pre.v_buffer = 0; |
440 | 1.42M | } |
441 | 2.21M | mt_decode_macroblock(pbi, xd, 0); |
442 | | |
443 | 2.21M | xd->left_available = 1; |
444 | | |
445 | | /* check if the boolean decoder has suffered an error */ |
446 | 2.21M | xd->corrupted |= vp8dx_bool_error(xd->current_bc); |
447 | | |
448 | 2.21M | xd->recon_above[0] += 16; |
449 | 2.21M | xd->recon_above[1] += 8; |
450 | 2.21M | xd->recon_above[2] += 8; |
451 | | |
452 | 2.21M | if (!pbi->common.filter_level) { |
453 | 95.4k | xd->recon_left[0] += 16; |
454 | 95.4k | xd->recon_left[1] += 8; |
455 | 95.4k | xd->recon_left[2] += 8; |
456 | 95.4k | } |
457 | | |
458 | 2.21M | if (pbi->common.filter_level) { |
459 | 2.00M | int skip_lf = (xd->mode_info_context->mbmi.mode != B_PRED && |
460 | 1.48M | xd->mode_info_context->mbmi.mode != SPLITMV && |
461 | 1.47M | xd->mode_info_context->mbmi.mb_skip_coeff); |
462 | | |
463 | 2.00M | const int mode_index = |
464 | 2.00M | lfi_n->mode_lf_lut[xd->mode_info_context->mbmi.mode]; |
465 | 2.00M | const int seg = xd->mode_info_context->mbmi.segment_id; |
466 | 2.00M | const int ref_frame = xd->mode_info_context->mbmi.ref_frame; |
467 | | |
468 | 2.00M | filter_level = lfi_n->lvl[seg][ref_frame][mode_index]; |
469 | | |
470 | 2.00M | if (mb_row != pc->mb_rows - 1) { |
471 | | /* Save decoded MB last row data for next-row decoding */ |
472 | 1.95M | memcpy((pbi->mt_yabove_row[mb_row + 1] + 32 + mb_col * 16), |
473 | 1.95M | (xd->dst.y_buffer + 15 * recon_y_stride), 16); |
474 | 1.95M | memcpy((pbi->mt_uabove_row[mb_row + 1] + 16 + mb_col * 8), |
475 | 1.95M | (xd->dst.u_buffer + 7 * recon_uv_stride), 8); |
476 | 1.95M | memcpy((pbi->mt_vabove_row[mb_row + 1] + 16 + mb_col * 8), |
477 | 1.95M | (xd->dst.v_buffer + 7 * recon_uv_stride), 8); |
478 | 1.95M | } |
479 | | |
480 | | /* save left_col for next MB decoding */ |
481 | 2.00M | if (mb_col != pc->mb_cols - 1) { |
482 | 1.96M | MODE_INFO *next = xd->mode_info_context + 1; |
483 | | |
484 | 1.96M | if (next->mbmi.ref_frame == INTRA_FRAME) { |
485 | 20.3M | for (i = 0; i < 16; ++i) { |
486 | 19.1M | pbi->mt_yleft_col[mb_row][i] = |
487 | 19.1M | xd->dst.y_buffer[i * recon_y_stride + 15]; |
488 | 19.1M | } |
489 | 10.7M | for (i = 0; i < 8; ++i) { |
490 | 9.53M | pbi->mt_uleft_col[mb_row][i] = |
491 | 9.53M | xd->dst.u_buffer[i * recon_uv_stride + 7]; |
492 | 9.53M | pbi->mt_vleft_col[mb_row][i] = |
493 | 9.53M | xd->dst.v_buffer[i * recon_uv_stride + 7]; |
494 | 9.53M | } |
495 | 1.20M | } |
496 | 1.96M | } |
497 | | |
498 | | /* loopfilter on this macroblock. */ |
499 | 2.00M | if (filter_level) { |
500 | 1.91M | if (pc->filter_type == NORMAL_LOOPFILTER) { |
501 | 1.34M | loop_filter_info lfi; |
502 | 1.34M | FRAME_TYPE frame_type = pc->frame_type; |
503 | 1.34M | const int hev_index = lfi_n->hev_thr_lut[frame_type][filter_level]; |
504 | 1.34M | lfi.mblim = lfi_n->mblim[filter_level]; |
505 | 1.34M | lfi.blim = lfi_n->blim[filter_level]; |
506 | 1.34M | lfi.lim = lfi_n->lim[filter_level]; |
507 | 1.34M | lfi.hev_thr = lfi_n->hev_thr[hev_index]; |
508 | | |
509 | 1.34M | if (mb_col > 0) |
510 | 1.32M | vp8_loop_filter_mbv(xd->dst.y_buffer, xd->dst.u_buffer, |
511 | 1.32M | xd->dst.v_buffer, recon_y_stride, |
512 | 1.32M | recon_uv_stride, &lfi); |
513 | | |
514 | 1.34M | if (!skip_lf) |
515 | 389k | vp8_loop_filter_bv(xd->dst.y_buffer, xd->dst.u_buffer, |
516 | 389k | xd->dst.v_buffer, recon_y_stride, |
517 | 389k | recon_uv_stride, &lfi); |
518 | | |
519 | | /* don't apply across umv border */ |
520 | 1.34M | if (mb_row > 0) |
521 | 1.42M | vp8_loop_filter_mbh(xd->dst.y_buffer, xd->dst.u_buffer, |
522 | 1.42M | xd->dst.v_buffer, recon_y_stride, |
523 | 1.42M | recon_uv_stride, &lfi); |
524 | | |
525 | 1.34M | if (!skip_lf) |
526 | 388k | vp8_loop_filter_bh(xd->dst.y_buffer, xd->dst.u_buffer, |
527 | 388k | xd->dst.v_buffer, recon_y_stride, |
528 | 388k | recon_uv_stride, &lfi); |
529 | 1.34M | } else { |
530 | 576k | if (mb_col > 0) |
531 | 555k | vp8_loop_filter_simple_mbv(xd->dst.y_buffer, recon_y_stride, |
532 | 555k | lfi_n->mblim[filter_level]); |
533 | | |
534 | 576k | if (!skip_lf) |
535 | 202k | vp8_loop_filter_simple_bv(xd->dst.y_buffer, recon_y_stride, |
536 | 202k | lfi_n->blim[filter_level]); |
537 | | |
538 | | /* don't apply across umv border */ |
539 | 576k | if (mb_row > 0) |
540 | 554k | vp8_loop_filter_simple_mbh(xd->dst.y_buffer, recon_y_stride, |
541 | 554k | lfi_n->mblim[filter_level]); |
542 | | |
543 | 576k | if (!skip_lf) |
544 | 202k | vp8_loop_filter_simple_bh(xd->dst.y_buffer, recon_y_stride, |
545 | 202k | lfi_n->blim[filter_level]); |
546 | 576k | } |
547 | 1.91M | } |
548 | 2.00M | } |
549 | | |
550 | 2.21M | recon_yoffset += 16; |
551 | 2.21M | recon_uvoffset += 8; |
552 | | |
553 | 2.21M | ++xd->mode_info_context; /* next mb */ |
554 | | |
555 | 2.21M | xd->above_context++; |
556 | 2.21M | } |
557 | | |
558 | | /* adjust to the next row of mbs */ |
559 | 70.8k | if (pbi->common.filter_level) { |
560 | 49.1k | if (mb_row != pc->mb_rows - 1) { |
561 | 45.0k | int lasty = yv12_fb_lst->y_width + VP8BORDERINPIXELS; |
562 | 45.0k | int lastuv = (yv12_fb_lst->y_width >> 1) + (VP8BORDERINPIXELS >> 1); |
563 | | |
564 | 225k | for (i = 0; i < 4; ++i) { |
565 | 180k | pbi->mt_yabove_row[mb_row + 1][lasty + i] = |
566 | 180k | pbi->mt_yabove_row[mb_row + 1][lasty - 1]; |
567 | 180k | pbi->mt_uabove_row[mb_row + 1][lastuv + i] = |
568 | 180k | pbi->mt_uabove_row[mb_row + 1][lastuv - 1]; |
569 | 180k | pbi->mt_vabove_row[mb_row + 1][lastuv + i] = |
570 | 180k | pbi->mt_vabove_row[mb_row + 1][lastuv - 1]; |
571 | 180k | } |
572 | 45.0k | } |
573 | 49.1k | } else { |
574 | 21.6k | vp8_extend_mb_row(yv12_fb_new, xd->dst.y_buffer + 16, |
575 | 21.6k | xd->dst.u_buffer + 8, xd->dst.v_buffer + 8); |
576 | 21.6k | } |
577 | | |
578 | | /* last MB of row is ready just after extension is done */ |
579 | 70.8k | vpx_atomic_store_release(current_mb_col, mb_col + nsync); |
580 | | |
581 | 70.8k | ++xd->mode_info_context; /* skip prediction column */ |
582 | 70.8k | xd->up_available = 1; |
583 | | |
584 | | /* since we have multithread */ |
585 | 70.8k | xd->mode_info_context += xd->mode_info_stride * pbi->decoding_thread_count; |
586 | 70.8k | } |
587 | | |
588 | | /* signal end of decoding of current thread for current frame */ |
589 | 26.9k | if (last_mb_row + (int)pbi->decoding_thread_count + 1 >= pc->mb_rows) |
590 | 7.52k | vp8_sem_post(&pbi->h_event_end_decoding); |
591 | 26.9k | } |
592 | | |
593 | 173k | static THREADFN thread_decoding_proc(void *p_data) { |
594 | 173k | int ithread = ((DECODETHREAD_DATA *)p_data)->ithread; |
595 | 173k | VP8D_COMP *pbi = (VP8D_COMP *)(((DECODETHREAD_DATA *)p_data)->ptr1); |
596 | 173k | MB_ROW_DEC *mbrd = (MB_ROW_DEC *)(((DECODETHREAD_DATA *)p_data)->ptr2); |
597 | 173k | ENTROPY_CONTEXT_PLANES mb_row_left_context; |
598 | | |
599 | 187k | while (1) { |
600 | 187k | if (vpx_atomic_load_acquire(&pbi->b_multithreaded_rd) == 0) break; |
601 | | |
602 | 186k | if (vp8_sem_wait(&pbi->h_event_start_decoding[ithread]) == 0) { |
603 | 186k | if (vpx_atomic_load_acquire(&pbi->b_multithreaded_rd) == 0) { |
604 | 173k | break; |
605 | 173k | } else { |
606 | 13.6k | MACROBLOCKD *xd = &mbrd->mbd; |
607 | 13.6k | xd->left_context = &mb_row_left_context; |
608 | 13.6k | if (setjmp(xd->error_info.jmp)) { |
609 | 10.5k | xd->error_info.setjmp = 0; |
610 | | // Signal the end of decoding for current thread. |
611 | 10.5k | vp8_sem_post(&pbi->h_event_end_decoding); |
612 | 10.5k | continue; |
613 | 10.5k | } |
614 | 3.16k | xd->error_info.setjmp = 1; |
615 | 3.16k | mt_decode_mb_rows(pbi, xd, ithread + 1); |
616 | 3.16k | xd->error_info.setjmp = 0; |
617 | 3.16k | } |
618 | 186k | } |
619 | 186k | } |
620 | | |
621 | 173k | return THREAD_EXIT_SUCCESS; |
622 | 173k | } |
623 | | |
624 | 26.4k | void vp8_decoder_create_threads(VP8D_COMP *pbi) { |
625 | 26.4k | int core_count = 0; |
626 | 26.4k | unsigned int ithread; |
627 | | |
628 | 26.4k | vpx_atomic_init(&pbi->b_multithreaded_rd, 0); |
629 | 26.4k | pbi->allocated_decoding_thread_count = 0; |
630 | | |
631 | | /* limit decoding threads to the max number of token partitions */ |
632 | 26.4k | core_count = (pbi->max_threads > 8) ? 8 : pbi->max_threads; |
633 | | |
634 | | /* limit decoding threads to the available cores */ |
635 | 26.4k | if (core_count > pbi->common.processor_core_count) { |
636 | 0 | core_count = pbi->common.processor_core_count; |
637 | 0 | } |
638 | | |
639 | 26.4k | if (core_count > 1) { |
640 | 25.5k | vpx_atomic_init(&pbi->b_multithreaded_rd, 1); |
641 | 25.5k | pbi->decoding_thread_count = core_count - 1; |
642 | | |
643 | 25.5k | CALLOC_ARRAY(pbi->h_decoding_thread, pbi->decoding_thread_count); |
644 | 25.5k | CALLOC_ARRAY(pbi->h_event_start_decoding, pbi->decoding_thread_count); |
645 | 25.5k | CALLOC_ARRAY_ALIGNED(pbi->mb_row_di, pbi->decoding_thread_count, 32); |
646 | 25.5k | CALLOC_ARRAY(pbi->de_thread_data, pbi->decoding_thread_count); |
647 | | |
648 | 25.5k | if (vp8_sem_init(&pbi->h_event_end_decoding, 0, 0)) { |
649 | 0 | vpx_internal_error(&pbi->common.error, VPX_CODEC_MEM_ERROR, |
650 | 0 | "Failed to initialize semaphore"); |
651 | 0 | } |
652 | | |
653 | 199k | for (ithread = 0; ithread < pbi->decoding_thread_count; ++ithread) { |
654 | 173k | if (vp8_sem_init(&pbi->h_event_start_decoding[ithread], 0, 0)) break; |
655 | | |
656 | 173k | vp8_setup_block_dptrs(&pbi->mb_row_di[ithread].mbd); |
657 | | |
658 | 173k | pbi->de_thread_data[ithread].ithread = ithread; |
659 | 173k | pbi->de_thread_data[ithread].ptr1 = (void *)pbi; |
660 | 173k | pbi->de_thread_data[ithread].ptr2 = (void *)&pbi->mb_row_di[ithread]; |
661 | | |
662 | 173k | if (pthread_create(&pbi->h_decoding_thread[ithread], 0, |
663 | 173k | thread_decoding_proc, &pbi->de_thread_data[ithread])) { |
664 | 0 | vp8_sem_destroy(&pbi->h_event_start_decoding[ithread]); |
665 | 0 | break; |
666 | 0 | } |
667 | 173k | } |
668 | | |
669 | 25.5k | pbi->allocated_decoding_thread_count = ithread; |
670 | 25.5k | if (pbi->allocated_decoding_thread_count != |
671 | 25.5k | (int)pbi->decoding_thread_count) { |
672 | | /* the remainder of cleanup cases will be handled in |
673 | | * vp8_decoder_remove_threads(). */ |
674 | 0 | if (pbi->allocated_decoding_thread_count == 0) { |
675 | 0 | vp8_sem_destroy(&pbi->h_event_end_decoding); |
676 | 0 | } |
677 | 0 | vpx_internal_error(&pbi->common.error, VPX_CODEC_MEM_ERROR, |
678 | 0 | "Failed to create threads"); |
679 | 0 | } |
680 | 25.5k | } |
681 | 26.4k | } |
682 | | |
683 | 95.8k | void vp8mt_de_alloc_temp_buffers(VP8D_COMP *pbi, int mb_rows) { |
684 | 95.8k | int i; |
685 | | |
686 | 95.8k | vpx_free(pbi->mt_current_mb_col); |
687 | 95.8k | pbi->mt_current_mb_col = NULL; |
688 | | |
689 | | /* Free above_row buffers. */ |
690 | 95.8k | if (pbi->mt_yabove_row) { |
691 | 5.64M | for (i = 0; i < mb_rows; ++i) { |
692 | 5.60M | vpx_free(pbi->mt_yabove_row[i]); |
693 | 5.60M | pbi->mt_yabove_row[i] = NULL; |
694 | 5.60M | } |
695 | 39.0k | vpx_free(pbi->mt_yabove_row); |
696 | 39.0k | pbi->mt_yabove_row = NULL; |
697 | 39.0k | } |
698 | | |
699 | 95.8k | if (pbi->mt_uabove_row) { |
700 | 5.64M | for (i = 0; i < mb_rows; ++i) { |
701 | 5.60M | vpx_free(pbi->mt_uabove_row[i]); |
702 | 5.60M | pbi->mt_uabove_row[i] = NULL; |
703 | 5.60M | } |
704 | 39.0k | vpx_free(pbi->mt_uabove_row); |
705 | 39.0k | pbi->mt_uabove_row = NULL; |
706 | 39.0k | } |
707 | | |
708 | 95.8k | if (pbi->mt_vabove_row) { |
709 | 5.64M | for (i = 0; i < mb_rows; ++i) { |
710 | 5.60M | vpx_free(pbi->mt_vabove_row[i]); |
711 | 5.60M | pbi->mt_vabove_row[i] = NULL; |
712 | 5.60M | } |
713 | 39.0k | vpx_free(pbi->mt_vabove_row); |
714 | 39.0k | pbi->mt_vabove_row = NULL; |
715 | 39.0k | } |
716 | | |
717 | | /* Free left_col buffers. */ |
718 | 95.8k | if (pbi->mt_yleft_col) { |
719 | 5.64M | for (i = 0; i < mb_rows; ++i) { |
720 | 5.60M | vpx_free(pbi->mt_yleft_col[i]); |
721 | 5.60M | pbi->mt_yleft_col[i] = NULL; |
722 | 5.60M | } |
723 | 39.0k | vpx_free(pbi->mt_yleft_col); |
724 | 39.0k | pbi->mt_yleft_col = NULL; |
725 | 39.0k | } |
726 | | |
727 | 95.8k | if (pbi->mt_uleft_col) { |
728 | 5.64M | for (i = 0; i < mb_rows; ++i) { |
729 | 5.60M | vpx_free(pbi->mt_uleft_col[i]); |
730 | 5.60M | pbi->mt_uleft_col[i] = NULL; |
731 | 5.60M | } |
732 | 39.0k | vpx_free(pbi->mt_uleft_col); |
733 | 39.0k | pbi->mt_uleft_col = NULL; |
734 | 39.0k | } |
735 | | |
736 | 95.8k | if (pbi->mt_vleft_col) { |
737 | 5.64M | for (i = 0; i < mb_rows; ++i) { |
738 | 5.60M | vpx_free(pbi->mt_vleft_col[i]); |
739 | 5.60M | pbi->mt_vleft_col[i] = NULL; |
740 | 5.60M | } |
741 | 39.0k | vpx_free(pbi->mt_vleft_col); |
742 | 39.0k | pbi->mt_vleft_col = NULL; |
743 | 39.0k | } |
744 | 95.8k | } |
745 | | |
746 | 39.0k | void vp8mt_alloc_temp_buffers(VP8D_COMP *pbi, int width, int prev_mb_rows) { |
747 | 39.0k | VP8_COMMON *const pc = &pbi->common; |
748 | 39.0k | int i; |
749 | 39.0k | int uv_width; |
750 | | |
751 | 39.0k | if (vpx_atomic_load_acquire(&pbi->b_multithreaded_rd)) { |
752 | 39.0k | vp8mt_de_alloc_temp_buffers(pbi, prev_mb_rows); |
753 | | |
754 | | /* our internal buffers are always multiples of 16 */ |
755 | 39.0k | if ((width & 0xf) != 0) width += 16 - (width & 0xf); |
756 | | |
757 | 39.0k | if (width < 640) { |
758 | 29.4k | pbi->sync_range = 1; |
759 | 29.4k | } else if (width <= 1280) { |
760 | 5.18k | pbi->sync_range = 8; |
761 | 5.18k | } else if (width <= 2560) { |
762 | 1.74k | pbi->sync_range = 16; |
763 | 2.67k | } else { |
764 | 2.67k | pbi->sync_range = 32; |
765 | 2.67k | } |
766 | | |
767 | 39.0k | uv_width = width >> 1; |
768 | | |
769 | | /* Allocate a vpx_atomic_int for each mb row. */ |
770 | 39.0k | CHECK_MEM_ERROR(&pc->error, pbi->mt_current_mb_col, |
771 | 39.0k | vpx_malloc(sizeof(*pbi->mt_current_mb_col) * pc->mb_rows)); |
772 | 5.64M | for (i = 0; i < pc->mb_rows; ++i) |
773 | 5.60M | vpx_atomic_init(&pbi->mt_current_mb_col[i], 0); |
774 | | |
775 | | /* Allocate memory for above_row buffers. */ |
776 | 39.0k | CALLOC_ARRAY(pbi->mt_yabove_row, pc->mb_rows); |
777 | 5.64M | for (i = 0; i < pc->mb_rows; ++i) { |
778 | 5.60M | CHECK_MEM_ERROR(&pc->error, pbi->mt_yabove_row[i], |
779 | 5.60M | vpx_memalign(16, sizeof(unsigned char) * |
780 | 5.60M | (width + (VP8BORDERINPIXELS << 1)))); |
781 | 5.60M | vp8_zero_array(pbi->mt_yabove_row[i], width + (VP8BORDERINPIXELS << 1)); |
782 | 5.60M | } |
783 | | |
784 | 39.0k | CALLOC_ARRAY(pbi->mt_uabove_row, pc->mb_rows); |
785 | 5.64M | for (i = 0; i < pc->mb_rows; ++i) { |
786 | 5.60M | CHECK_MEM_ERROR(&pc->error, pbi->mt_uabove_row[i], |
787 | 5.60M | vpx_memalign(16, sizeof(unsigned char) * |
788 | 5.60M | (uv_width + VP8BORDERINPIXELS))); |
789 | 5.60M | vp8_zero_array(pbi->mt_uabove_row[i], uv_width + VP8BORDERINPIXELS); |
790 | 5.60M | } |
791 | | |
792 | 39.0k | CALLOC_ARRAY(pbi->mt_vabove_row, pc->mb_rows); |
793 | 5.64M | for (i = 0; i < pc->mb_rows; ++i) { |
794 | 5.60M | CHECK_MEM_ERROR(&pc->error, pbi->mt_vabove_row[i], |
795 | 5.60M | vpx_memalign(16, sizeof(unsigned char) * |
796 | 5.60M | (uv_width + VP8BORDERINPIXELS))); |
797 | 5.60M | vp8_zero_array(pbi->mt_vabove_row[i], uv_width + VP8BORDERINPIXELS); |
798 | 5.60M | } |
799 | | |
800 | | /* Allocate memory for left_col buffers. */ |
801 | 39.0k | CALLOC_ARRAY(pbi->mt_yleft_col, pc->mb_rows); |
802 | 5.64M | for (i = 0; i < pc->mb_rows; ++i) |
803 | 5.60M | CHECK_MEM_ERROR(&pc->error, pbi->mt_yleft_col[i], |
804 | 39.0k | vpx_calloc(sizeof(unsigned char) * 16, 1)); |
805 | | |
806 | 39.0k | CALLOC_ARRAY(pbi->mt_uleft_col, pc->mb_rows); |
807 | 5.64M | for (i = 0; i < pc->mb_rows; ++i) |
808 | 5.60M | CHECK_MEM_ERROR(&pc->error, pbi->mt_uleft_col[i], |
809 | 39.0k | vpx_calloc(sizeof(unsigned char) * 8, 1)); |
810 | | |
811 | 39.0k | CALLOC_ARRAY(pbi->mt_vleft_col, pc->mb_rows); |
812 | 5.64M | for (i = 0; i < pc->mb_rows; ++i) |
813 | 5.60M | CHECK_MEM_ERROR(&pc->error, pbi->mt_vleft_col[i], |
814 | 39.0k | vpx_calloc(sizeof(unsigned char) * 8, 1)); |
815 | 39.0k | } |
816 | 39.0k | } |
817 | | |
818 | 27.6k | void vp8_decoder_remove_threads(VP8D_COMP *pbi) { |
819 | | /* shutdown MB Decoding thread; */ |
820 | 27.6k | if (vpx_atomic_load_acquire(&pbi->b_multithreaded_rd)) { |
821 | 25.5k | int i; |
822 | 25.5k | vpx_atomic_store_release(&pbi->b_multithreaded_rd, 0); |
823 | | |
824 | | /* allow all threads to exit */ |
825 | 199k | for (i = 0; i < pbi->allocated_decoding_thread_count; ++i) { |
826 | 173k | vp8_sem_post(&pbi->h_event_start_decoding[i]); |
827 | 173k | pthread_join(pbi->h_decoding_thread[i], NULL); |
828 | 173k | } |
829 | | |
830 | 199k | for (i = 0; i < pbi->allocated_decoding_thread_count; ++i) { |
831 | 173k | vp8_sem_destroy(&pbi->h_event_start_decoding[i]); |
832 | 173k | } |
833 | | |
834 | 25.5k | if (pbi->allocated_decoding_thread_count) { |
835 | 25.5k | vp8_sem_destroy(&pbi->h_event_end_decoding); |
836 | 25.5k | } |
837 | | |
838 | 25.5k | vpx_free(pbi->h_decoding_thread); |
839 | 25.5k | pbi->h_decoding_thread = NULL; |
840 | | |
841 | 25.5k | vpx_free(pbi->h_event_start_decoding); |
842 | 25.5k | pbi->h_event_start_decoding = NULL; |
843 | | |
844 | 25.5k | vpx_free(pbi->mb_row_di); |
845 | 25.5k | pbi->mb_row_di = NULL; |
846 | | |
847 | 25.5k | vpx_free(pbi->de_thread_data); |
848 | 25.5k | pbi->de_thread_data = NULL; |
849 | | |
850 | 25.5k | vp8mt_de_alloc_temp_buffers(pbi, pbi->common.mb_rows); |
851 | 25.5k | } |
852 | 27.6k | } |
853 | | |
854 | 13.2k | int vp8mt_decode_mb_rows(VP8D_COMP *pbi, MACROBLOCKD *xd) { |
855 | 13.2k | VP8_COMMON *pc = &pbi->common; |
856 | 13.2k | unsigned int i; |
857 | 13.2k | int j; |
858 | | |
859 | 13.2k | int filter_level = pc->filter_level; |
860 | 13.2k | YV12_BUFFER_CONFIG *yv12_fb_new = pbi->dec_fb_ref[INTRA_FRAME]; |
861 | | |
862 | 13.2k | if (filter_level) { |
863 | | /* Set above_row buffer to 127 for decoding first MB row */ |
864 | 12.6k | memset(pbi->mt_yabove_row[0] + VP8BORDERINPIXELS - 1, 127, |
865 | 12.6k | yv12_fb_new->y_width + 5); |
866 | 12.6k | memset(pbi->mt_uabove_row[0] + (VP8BORDERINPIXELS >> 1) - 1, 127, |
867 | 12.6k | (yv12_fb_new->y_width >> 1) + 5); |
868 | 12.6k | memset(pbi->mt_vabove_row[0] + (VP8BORDERINPIXELS >> 1) - 1, 127, |
869 | 12.6k | (yv12_fb_new->y_width >> 1) + 5); |
870 | | |
871 | 1.99M | for (j = 1; j < pc->mb_rows; ++j) { |
872 | 1.97M | memset(pbi->mt_yabove_row[j] + VP8BORDERINPIXELS - 1, (unsigned char)129, |
873 | 1.97M | 1); |
874 | 1.97M | memset(pbi->mt_uabove_row[j] + (VP8BORDERINPIXELS >> 1) - 1, |
875 | 1.97M | (unsigned char)129, 1); |
876 | 1.97M | memset(pbi->mt_vabove_row[j] + (VP8BORDERINPIXELS >> 1) - 1, |
877 | 1.97M | (unsigned char)129, 1); |
878 | 1.97M | } |
879 | | |
880 | | /* Set left_col to 129 initially */ |
881 | 2.00M | for (j = 0; j < pc->mb_rows; ++j) { |
882 | 1.99M | memset(pbi->mt_yleft_col[j], (unsigned char)129, 16); |
883 | 1.99M | memset(pbi->mt_uleft_col[j], (unsigned char)129, 8); |
884 | 1.99M | memset(pbi->mt_vleft_col[j], (unsigned char)129, 8); |
885 | 1.99M | } |
886 | | |
887 | | /* Initialize the loop filter for this frame. */ |
888 | 12.6k | vp8_loop_filter_frame_init(pc, &pbi->mb, filter_level); |
889 | 12.6k | } else { |
890 | 650 | vp8_setup_intra_recon_top_line(yv12_fb_new); |
891 | 650 | } |
892 | | |
893 | 13.2k | setup_decoding_thread_data(pbi, xd, pbi->mb_row_di, |
894 | 13.2k | pbi->decoding_thread_count); |
895 | | |
896 | 26.9k | for (i = 0; i < pbi->decoding_thread_count; ++i) { |
897 | 13.7k | vp8_sem_post(&pbi->h_event_start_decoding[i]); |
898 | 13.7k | } |
899 | | |
900 | 13.2k | if (setjmp(xd->error_info.jmp)) { |
901 | 8.94k | xd->error_info.setjmp = 0; |
902 | 8.94k | xd->corrupted = 1; |
903 | | // Wait for other threads to finish. This prevents other threads decoding |
904 | | // the current frame while the main thread starts decoding the next frame, |
905 | | // which causes a data race. |
906 | 19.1k | for (i = 0; i < pbi->decoding_thread_count; ++i) |
907 | 10.2k | vp8_sem_wait(&pbi->h_event_end_decoding); |
908 | 8.94k | return -1; |
909 | 8.94k | } |
910 | | |
911 | 4.33k | xd->error_info.setjmp = 1; |
912 | 4.33k | mt_decode_mb_rows(pbi, xd, 0); |
913 | 4.33k | xd->error_info.setjmp = 0; |
914 | | |
915 | 12.1k | for (i = 0; i < pbi->decoding_thread_count + 1; ++i) |
916 | 7.83k | vp8_sem_wait(&pbi->h_event_end_decoding); /* add back for each frame */ |
917 | | |
918 | 4.33k | return 0; |
919 | 13.2k | } |