Coverage Report

Created: 2026-07-25 06:58

next uncovered line (L), next uncovered region (R), next uncovered branch (B)
/src/zlib-ng/adler32_p.h
Line
Count
Source
1
/* adler32_p.h -- Private inline functions and macros shared with
2
 *                different computation of the Adler-32 checksum
3
 *                of a data stream.
4
 * Copyright (C) 1995-2011, 2016 Mark Adler
5
 * For conditions of distribution and use, see copyright notice in zlib.h
6
 */
7
8
#ifndef ADLER32_P_H
9
#define ADLER32_P_H
10
11
#include "zendian.h"
12
13
240k
#define BASE 65521U     /* largest prime smaller than 65536 */
14
28.0k
#define NMAX 5552
15
/* NMAX is the largest n such that 255n(n+1)/2 + (n+1)(BASE-1) <= 2^32-1 */
16
#define NMAX_ALIGNED32 (NMAX & ~31)
17
/* NMAX rounded down to a multiple of 32 is 5536 */
18
19
154k
#define ADLER_DO1(sum1, sum2, buf, i)  {(sum1) += buf[(i)]; (sum2) += (sum1);}
20
66.8k
#define ADLER_DO2(sum1, sum2, buf, i)  {ADLER_DO1(sum1, sum2, buf, i); ADLER_DO1(sum1, sum2, buf, i+1);}
21
21.1k
#define ADLER_DO4(sum1, sum2, buf, i)  {ADLER_DO2(sum1, sum2, buf, i); ADLER_DO2(sum1, sum2, buf, i+2);}
22
#define ADLER_DO8(sum1, sum2, buf, i)  {ADLER_DO4(sum1, sum2, buf, i); ADLER_DO4(sum1, sum2, buf, i+4);}
23
#define ADLER_DO16(sum1, sum2, buf)    {ADLER_DO8(sum1, sum2, buf, 0); ADLER_DO8(sum1, sum2, buf, 8);}
24
25
Z_FORCEINLINE static void adler32_copy_align(uint32_t *Z_RESTRICT adler, uint8_t *dst, const uint8_t *buf, size_t len,
26
0
                                             uint32_t *Z_RESTRICT sum2, const int MAX_LEN, const int COPY) {
27
0
    Z_UNUSED(MAX_LEN);
28
0
    if (len & 1) {
29
0
        if (COPY) {
30
0
            *dst = *buf;
31
0
            dst += 1;
32
0
        }
33
0
        ADLER_DO1(*adler, *sum2, buf, 0);
34
0
        buf += 1;
35
0
    }
36
0
    if (len & 2) {
37
0
        if (COPY) {
38
0
            memcpy(dst, buf, 2);
39
0
            dst += 2;
40
0
        }
41
0
        ADLER_DO2(*adler, *sum2, buf, 0);
42
0
        buf += 2;
43
0
    }
44
0
    while (len >= 4) {
45
0
        if (COPY) {
46
0
            memcpy(dst, buf, 4);
47
0
            dst += 4;
48
0
        }
49
0
        len -= 4;
50
0
        ADLER_DO4(*adler, *sum2, buf, 0);
51
0
        buf += 4;
52
0
    }
53
0
}
Unexecuted instantiation: adler32_ssse3.c:adler32_copy_align
Unexecuted instantiation: adler32_sse42.c:adler32_copy_align
Unexecuted instantiation: adler32_avx2.c:adler32_copy_align
Unexecuted instantiation: adler32_avx2_vnni.c:adler32_copy_align
Unexecuted instantiation: adler32_avx512.c:adler32_copy_align
Unexecuted instantiation: adler32_avx512_vnni.c:adler32_copy_align
Unexecuted instantiation: adler32_c.c:adler32_copy_align
54
55
/* SIMD Within A Register (SWAR) scalar adler32. Splits bytes into
56
 * even/odd lanes packed as 4x16-bit in uint64_t, with prefix sums for s2.
57
 * Reduction uses multiply-and-shift with positional weight constants.
58
 *
59
 * Technique pioneered by Michael Niedermayer <michaelni@gmx.at>.
60
 * Max chunk: 23 iterations * 8 bytes = 184 (255*23 = 5865 < 65535). */
61
#define ADLER32_SWAR_MAX_BYTES   (23 * 8)
62
43.7k
#define ADLER32_SWAR_EVEN_MASK   0x00FF00FF00FF00FFULL
63
43.7k
#define ADLER32_SWAR_HSUM        0x1000100010001ULL
64
65
Z_FORCEINLINE static void adler32_swar(uint32_t *adler, uint8_t *dst, const uint8_t *buf, size_t len,
66
21.8k
                                       uint32_t *sum2, const int COPY) {
67
21.8k
    uint64_t sum_even = 0, sum_odd = 0, prefix_even = 0, prefix_odd = 0;
68
69
21.8k
    *sum2 += *adler * (uint32_t)len;
70
71
21.8k
    const uint64_t *src64 = (const uint64_t *)buf;
72
73
21.8k
    while (len >= 16) {
74
0
        uint64_t v0 = src64[0];
75
0
        uint64_t v1 = src64[1];
76
0
        if (COPY) {
77
0
            memcpy(dst, &v0, sizeof(v0));
78
0
            memcpy(dst + 8, &v1, sizeof(v1));
79
0
            dst += 16;
80
0
        }
81
82
0
        prefix_even += sum_even;
83
0
        prefix_odd += sum_odd;
84
0
        sum_even +=  v0       & ADLER32_SWAR_EVEN_MASK;
85
0
        sum_odd  += (v0 >> 8) & ADLER32_SWAR_EVEN_MASK;
86
87
0
        prefix_even += sum_even;
88
0
        prefix_odd += sum_odd;
89
0
        sum_even +=  v1       & ADLER32_SWAR_EVEN_MASK;
90
0
        sum_odd  += (v1 >> 8) & ADLER32_SWAR_EVEN_MASK;
91
92
0
        src64 += 2;
93
0
        len -= 16;
94
0
    }
95
96
    /* Handle remaining 8 bytes if present */
97
21.8k
    if (len >= 8) {
98
21.8k
        uint64_t v = *src64;
99
21.8k
        if (COPY)
100
5.28k
            memcpy(dst, &v, sizeof(v));
101
102
21.8k
        prefix_even += sum_even;
103
21.8k
        prefix_odd += sum_odd;
104
21.8k
        sum_even +=  v       & ADLER32_SWAR_EVEN_MASK;
105
21.8k
        sum_odd  += (v >> 8) & ADLER32_SWAR_EVEN_MASK;
106
21.8k
    }
107
108
    /* Horizontal sum of 4x16-bit lanes for s1 */
109
21.8k
    *adler += (uint32_t)(((sum_even + sum_odd) * ADLER32_SWAR_HSUM) >> 48);
110
111
    /* Widen prefix sums to 32-bit pairs and horizontal sum for s2 */
112
21.8k
    uint64_t pe_lo = prefix_even & 0xFFFF0000FFFFULL;
113
21.8k
    uint64_t pe_hi = (prefix_even >> 16) & 0xFFFF0000FFFFULL;
114
21.8k
    uint64_t po_lo = prefix_odd & 0xFFFF0000FFFFULL;
115
21.8k
    uint64_t po_hi = (prefix_odd >> 16) & 0xFFFF0000FFFFULL;
116
117
21.8k
    *sum2 += (uint32_t)(((pe_lo + po_lo + pe_hi + po_hi) * 0x800000008ULL) >> 32);
118
119
    /* Positional weights [8,7,6,5,4,3,2,1] per 8-byte group for s2.
120
     * On big-endian the even mask captures odd-index memory bytes (b1,b3,b5,b7)
121
     * so HSUM (+1 per odd-index byte) must be applied to sum_even, not sum_odd. */
122
21.8k
#if BYTE_ORDER == LITTLE_ENDIAN
123
21.8k
    *sum2 += 2 * (uint32_t)((sum_even * 0x4000300020001ULL) >> 48)
124
21.8k
           +     (uint32_t)((sum_odd  * ADLER32_SWAR_HSUM) >> 48)
125
21.8k
           + 2 * (uint32_t)((sum_odd  * 0x3000200010000ULL) >> 48);
126
#else
127
    *sum2 += 2 * (uint32_t)((sum_even * 0x0000100020003ULL) >> 48)
128
           +     (uint32_t)((sum_even * ADLER32_SWAR_HSUM) >> 48)
129
           + 2 * (uint32_t)((sum_odd  * 0x1000200030004ULL) >> 48);
130
#endif
131
21.8k
}
adler32_ssse3.c:adler32_swar
Line
Count
Source
66
7.96k
                                       uint32_t *sum2, const int COPY) {
67
7.96k
    uint64_t sum_even = 0, sum_odd = 0, prefix_even = 0, prefix_odd = 0;
68
69
7.96k
    *sum2 += *adler * (uint32_t)len;
70
71
7.96k
    const uint64_t *src64 = (const uint64_t *)buf;
72
73
7.96k
    while (len >= 16) {
74
0
        uint64_t v0 = src64[0];
75
0
        uint64_t v1 = src64[1];
76
0
        if (COPY) {
77
0
            memcpy(dst, &v0, sizeof(v0));
78
0
            memcpy(dst + 8, &v1, sizeof(v1));
79
0
            dst += 16;
80
0
        }
81
82
0
        prefix_even += sum_even;
83
0
        prefix_odd += sum_odd;
84
0
        sum_even +=  v0       & ADLER32_SWAR_EVEN_MASK;
85
0
        sum_odd  += (v0 >> 8) & ADLER32_SWAR_EVEN_MASK;
86
87
0
        prefix_even += sum_even;
88
0
        prefix_odd += sum_odd;
89
0
        sum_even +=  v1       & ADLER32_SWAR_EVEN_MASK;
90
0
        sum_odd  += (v1 >> 8) & ADLER32_SWAR_EVEN_MASK;
91
92
0
        src64 += 2;
93
0
        len -= 16;
94
0
    }
95
96
    /* Handle remaining 8 bytes if present */
97
7.96k
    if (len >= 8) {
98
7.96k
        uint64_t v = *src64;
99
7.96k
        if (COPY)
100
0
            memcpy(dst, &v, sizeof(v));
101
102
7.96k
        prefix_even += sum_even;
103
7.96k
        prefix_odd += sum_odd;
104
7.96k
        sum_even +=  v       & ADLER32_SWAR_EVEN_MASK;
105
7.96k
        sum_odd  += (v >> 8) & ADLER32_SWAR_EVEN_MASK;
106
7.96k
    }
107
108
    /* Horizontal sum of 4x16-bit lanes for s1 */
109
7.96k
    *adler += (uint32_t)(((sum_even + sum_odd) * ADLER32_SWAR_HSUM) >> 48);
110
111
    /* Widen prefix sums to 32-bit pairs and horizontal sum for s2 */
112
7.96k
    uint64_t pe_lo = prefix_even & 0xFFFF0000FFFFULL;
113
7.96k
    uint64_t pe_hi = (prefix_even >> 16) & 0xFFFF0000FFFFULL;
114
7.96k
    uint64_t po_lo = prefix_odd & 0xFFFF0000FFFFULL;
115
7.96k
    uint64_t po_hi = (prefix_odd >> 16) & 0xFFFF0000FFFFULL;
116
117
7.96k
    *sum2 += (uint32_t)(((pe_lo + po_lo + pe_hi + po_hi) * 0x800000008ULL) >> 32);
118
119
    /* Positional weights [8,7,6,5,4,3,2,1] per 8-byte group for s2.
120
     * On big-endian the even mask captures odd-index memory bytes (b1,b3,b5,b7)
121
     * so HSUM (+1 per odd-index byte) must be applied to sum_even, not sum_odd. */
122
7.96k
#if BYTE_ORDER == LITTLE_ENDIAN
123
7.96k
    *sum2 += 2 * (uint32_t)((sum_even * 0x4000300020001ULL) >> 48)
124
7.96k
           +     (uint32_t)((sum_odd  * ADLER32_SWAR_HSUM) >> 48)
125
7.96k
           + 2 * (uint32_t)((sum_odd  * 0x3000200010000ULL) >> 48);
126
#else
127
    *sum2 += 2 * (uint32_t)((sum_even * 0x0000100020003ULL) >> 48)
128
           +     (uint32_t)((sum_even * ADLER32_SWAR_HSUM) >> 48)
129
           + 2 * (uint32_t)((sum_odd  * 0x1000200030004ULL) >> 48);
130
#endif
131
7.96k
}
adler32_sse42.c:adler32_swar
Line
Count
Source
66
2.34k
                                       uint32_t *sum2, const int COPY) {
67
2.34k
    uint64_t sum_even = 0, sum_odd = 0, prefix_even = 0, prefix_odd = 0;
68
69
2.34k
    *sum2 += *adler * (uint32_t)len;
70
71
2.34k
    const uint64_t *src64 = (const uint64_t *)buf;
72
73
2.34k
    while (len >= 16) {
74
0
        uint64_t v0 = src64[0];
75
0
        uint64_t v1 = src64[1];
76
0
        if (COPY) {
77
0
            memcpy(dst, &v0, sizeof(v0));
78
0
            memcpy(dst + 8, &v1, sizeof(v1));
79
0
            dst += 16;
80
0
        }
81
82
0
        prefix_even += sum_even;
83
0
        prefix_odd += sum_odd;
84
0
        sum_even +=  v0       & ADLER32_SWAR_EVEN_MASK;
85
0
        sum_odd  += (v0 >> 8) & ADLER32_SWAR_EVEN_MASK;
86
87
0
        prefix_even += sum_even;
88
0
        prefix_odd += sum_odd;
89
0
        sum_even +=  v1       & ADLER32_SWAR_EVEN_MASK;
90
0
        sum_odd  += (v1 >> 8) & ADLER32_SWAR_EVEN_MASK;
91
92
0
        src64 += 2;
93
0
        len -= 16;
94
0
    }
95
96
    /* Handle remaining 8 bytes if present */
97
2.34k
    if (len >= 8) {
98
2.34k
        uint64_t v = *src64;
99
2.34k
        if (COPY)
100
2.34k
            memcpy(dst, &v, sizeof(v));
101
102
2.34k
        prefix_even += sum_even;
103
2.34k
        prefix_odd += sum_odd;
104
2.34k
        sum_even +=  v       & ADLER32_SWAR_EVEN_MASK;
105
2.34k
        sum_odd  += (v >> 8) & ADLER32_SWAR_EVEN_MASK;
106
2.34k
    }
107
108
    /* Horizontal sum of 4x16-bit lanes for s1 */
109
2.34k
    *adler += (uint32_t)(((sum_even + sum_odd) * ADLER32_SWAR_HSUM) >> 48);
110
111
    /* Widen prefix sums to 32-bit pairs and horizontal sum for s2 */
112
2.34k
    uint64_t pe_lo = prefix_even & 0xFFFF0000FFFFULL;
113
2.34k
    uint64_t pe_hi = (prefix_even >> 16) & 0xFFFF0000FFFFULL;
114
2.34k
    uint64_t po_lo = prefix_odd & 0xFFFF0000FFFFULL;
115
2.34k
    uint64_t po_hi = (prefix_odd >> 16) & 0xFFFF0000FFFFULL;
116
117
2.34k
    *sum2 += (uint32_t)(((pe_lo + po_lo + pe_hi + po_hi) * 0x800000008ULL) >> 32);
118
119
    /* Positional weights [8,7,6,5,4,3,2,1] per 8-byte group for s2.
120
     * On big-endian the even mask captures odd-index memory bytes (b1,b3,b5,b7)
121
     * so HSUM (+1 per odd-index byte) must be applied to sum_even, not sum_odd. */
122
2.34k
#if BYTE_ORDER == LITTLE_ENDIAN
123
2.34k
    *sum2 += 2 * (uint32_t)((sum_even * 0x4000300020001ULL) >> 48)
124
2.34k
           +     (uint32_t)((sum_odd  * ADLER32_SWAR_HSUM) >> 48)
125
2.34k
           + 2 * (uint32_t)((sum_odd  * 0x3000200010000ULL) >> 48);
126
#else
127
    *sum2 += 2 * (uint32_t)((sum_even * 0x0000100020003ULL) >> 48)
128
           +     (uint32_t)((sum_even * ADLER32_SWAR_HSUM) >> 48)
129
           + 2 * (uint32_t)((sum_odd  * 0x1000200030004ULL) >> 48);
130
#endif
131
2.34k
}
adler32_avx2.c:adler32_swar
Line
Count
Source
66
11.5k
                                       uint32_t *sum2, const int COPY) {
67
11.5k
    uint64_t sum_even = 0, sum_odd = 0, prefix_even = 0, prefix_odd = 0;
68
69
11.5k
    *sum2 += *adler * (uint32_t)len;
70
71
11.5k
    const uint64_t *src64 = (const uint64_t *)buf;
72
73
11.5k
    while (len >= 16) {
74
0
        uint64_t v0 = src64[0];
75
0
        uint64_t v1 = src64[1];
76
0
        if (COPY) {
77
0
            memcpy(dst, &v0, sizeof(v0));
78
0
            memcpy(dst + 8, &v1, sizeof(v1));
79
0
            dst += 16;
80
0
        }
81
82
0
        prefix_even += sum_even;
83
0
        prefix_odd += sum_odd;
84
0
        sum_even +=  v0       & ADLER32_SWAR_EVEN_MASK;
85
0
        sum_odd  += (v0 >> 8) & ADLER32_SWAR_EVEN_MASK;
86
87
0
        prefix_even += sum_even;
88
0
        prefix_odd += sum_odd;
89
0
        sum_even +=  v1       & ADLER32_SWAR_EVEN_MASK;
90
0
        sum_odd  += (v1 >> 8) & ADLER32_SWAR_EVEN_MASK;
91
92
0
        src64 += 2;
93
0
        len -= 16;
94
0
    }
95
96
    /* Handle remaining 8 bytes if present */
97
11.5k
    if (len >= 8) {
98
11.5k
        uint64_t v = *src64;
99
11.5k
        if (COPY)
100
2.93k
            memcpy(dst, &v, sizeof(v));
101
102
11.5k
        prefix_even += sum_even;
103
11.5k
        prefix_odd += sum_odd;
104
11.5k
        sum_even +=  v       & ADLER32_SWAR_EVEN_MASK;
105
11.5k
        sum_odd  += (v >> 8) & ADLER32_SWAR_EVEN_MASK;
106
11.5k
    }
107
108
    /* Horizontal sum of 4x16-bit lanes for s1 */
109
11.5k
    *adler += (uint32_t)(((sum_even + sum_odd) * ADLER32_SWAR_HSUM) >> 48);
110
111
    /* Widen prefix sums to 32-bit pairs and horizontal sum for s2 */
112
11.5k
    uint64_t pe_lo = prefix_even & 0xFFFF0000FFFFULL;
113
11.5k
    uint64_t pe_hi = (prefix_even >> 16) & 0xFFFF0000FFFFULL;
114
11.5k
    uint64_t po_lo = prefix_odd & 0xFFFF0000FFFFULL;
115
11.5k
    uint64_t po_hi = (prefix_odd >> 16) & 0xFFFF0000FFFFULL;
116
117
11.5k
    *sum2 += (uint32_t)(((pe_lo + po_lo + pe_hi + po_hi) * 0x800000008ULL) >> 32);
118
119
    /* Positional weights [8,7,6,5,4,3,2,1] per 8-byte group for s2.
120
     * On big-endian the even mask captures odd-index memory bytes (b1,b3,b5,b7)
121
     * so HSUM (+1 per odd-index byte) must be applied to sum_even, not sum_odd. */
122
11.5k
#if BYTE_ORDER == LITTLE_ENDIAN
123
11.5k
    *sum2 += 2 * (uint32_t)((sum_even * 0x4000300020001ULL) >> 48)
124
11.5k
           +     (uint32_t)((sum_odd  * ADLER32_SWAR_HSUM) >> 48)
125
11.5k
           + 2 * (uint32_t)((sum_odd  * 0x3000200010000ULL) >> 48);
126
#else
127
    *sum2 += 2 * (uint32_t)((sum_even * 0x0000100020003ULL) >> 48)
128
           +     (uint32_t)((sum_even * ADLER32_SWAR_HSUM) >> 48)
129
           + 2 * (uint32_t)((sum_odd  * 0x1000200030004ULL) >> 48);
130
#endif
131
11.5k
}
Unexecuted instantiation: adler32_avx2_vnni.c:adler32_swar
Unexecuted instantiation: adler32_avx512.c:adler32_swar
Unexecuted instantiation: adler32_avx512_vnni.c:adler32_swar
Unexecuted instantiation: adler32_c.c:adler32_swar
132
133
Z_FORCEINLINE static uint32_t adler32_copy_tail(uint32_t adler, uint8_t *dst, const uint8_t *buf, size_t len,
134
42.7k
                                                uint32_t sum2, const int REBASE, const int MAX_LEN, const int COPY) {
135
42.7k
    if (len) {
136
41.8k
        Z_UNUSED(MAX_LEN);
137
        /* Process using packed 64-bit arithmetic when source is aligned */
138
63.7k
        while (len >= 8 && ((uintptr_t)buf & 7) == 0) {
139
21.8k
            size_t chunk = MIN(ALIGN_DOWN(len, (size_t)8), (size_t)ADLER32_SWAR_MAX_BYTES);
140
21.8k
            adler32_swar(&adler, dst, buf, chunk, &sum2, COPY);
141
21.8k
            buf += chunk;
142
21.8k
            if (COPY)
143
5.28k
                dst += chunk;
144
21.8k
            len -= chunk;
145
21.8k
        }
146
        /* DO4 loop avoids GCC x86 register pressure from hoisted DO8/DO16 loads. */
147
63.0k
        while (len >= 4) {
148
21.1k
            if (COPY) {
149
6.33k
                memcpy(dst, buf, 4);
150
6.33k
                dst += 4;
151
6.33k
            }
152
21.1k
            len -= 4;
153
21.1k
            ADLER_DO4(adler, sum2, buf, 0);
154
21.1k
            buf += 4;
155
21.1k
        }
156
41.8k
        if (len & 2) {
157
24.5k
            if (COPY) {
158
6.39k
                memcpy(dst, buf, 2);
159
6.39k
                dst += 2;
160
6.39k
            }
161
24.5k
            ADLER_DO2(adler, sum2, buf, 0);
162
24.5k
            buf += 2;
163
24.5k
        }
164
41.8k
        if (len & 1) {
165
21.2k
            if (COPY)
166
5.55k
                *dst = *buf;
167
21.2k
            ADLER_DO1(adler, sum2, buf, 0);
168
21.2k
        }
169
41.8k
    }
170
42.7k
    if (REBASE) {
171
42.2k
        adler %= BASE;
172
42.2k
        sum2 %= BASE;
173
42.2k
    }
174
    /* D = B * 65536 + A, see: https://en.wikipedia.org/wiki/Adler-32. */
175
42.7k
    return adler | (sum2 << 16);
176
42.7k
}
adler32_ssse3.c:adler32_copy_tail
Line
Count
Source
134
14.0k
                                                uint32_t sum2, const int REBASE, const int MAX_LEN, const int COPY) {
135
14.0k
    if (len) {
136
13.4k
        Z_UNUSED(MAX_LEN);
137
        /* Process using packed 64-bit arithmetic when source is aligned */
138
21.4k
        while (len >= 8 && ((uintptr_t)buf & 7) == 0) {
139
7.96k
            size_t chunk = MIN(ALIGN_DOWN(len, (size_t)8), (size_t)ADLER32_SWAR_MAX_BYTES);
140
7.96k
            adler32_swar(&adler, dst, buf, chunk, &sum2, COPY);
141
7.96k
            buf += chunk;
142
7.96k
            if (COPY)
143
0
                dst += chunk;
144
7.96k
            len -= chunk;
145
7.96k
        }
146
        /* DO4 loop avoids GCC x86 register pressure from hoisted DO8/DO16 loads. */
147
21.3k
        while (len >= 4) {
148
7.82k
            if (COPY) {
149
0
                memcpy(dst, buf, 4);
150
0
                dst += 4;
151
0
            }
152
7.82k
            len -= 4;
153
7.82k
            ADLER_DO4(adler, sum2, buf, 0);
154
7.82k
            buf += 4;
155
7.82k
        }
156
13.4k
        if (len & 2) {
157
8.68k
            if (COPY) {
158
0
                memcpy(dst, buf, 2);
159
0
                dst += 2;
160
0
            }
161
8.68k
            ADLER_DO2(adler, sum2, buf, 0);
162
8.68k
            buf += 2;
163
8.68k
        }
164
13.4k
        if (len & 1) {
165
7.10k
            if (COPY)
166
0
                *dst = *buf;
167
7.10k
            ADLER_DO1(adler, sum2, buf, 0);
168
7.10k
        }
169
13.4k
    }
170
14.0k
    if (REBASE) {
171
13.4k
        adler %= BASE;
172
13.4k
        sum2 %= BASE;
173
13.4k
    }
174
    /* D = B * 65536 + A, see: https://en.wikipedia.org/wiki/Adler-32. */
175
14.0k
    return adler | (sum2 << 16);
176
14.0k
}
adler32_sse42.c:adler32_copy_tail
Line
Count
Source
134
4.77k
                                                uint32_t sum2, const int REBASE, const int MAX_LEN, const int COPY) {
135
4.77k
    if (len) {
136
4.77k
        Z_UNUSED(MAX_LEN);
137
        /* Process using packed 64-bit arithmetic when source is aligned */
138
7.12k
        while (len >= 8 && ((uintptr_t)buf & 7) == 0) {
139
2.34k
            size_t chunk = MIN(ALIGN_DOWN(len, (size_t)8), (size_t)ADLER32_SWAR_MAX_BYTES);
140
2.34k
            adler32_swar(&adler, dst, buf, chunk, &sum2, COPY);
141
2.34k
            buf += chunk;
142
2.34k
            if (COPY)
143
2.34k
                dst += chunk;
144
2.34k
            len -= chunk;
145
2.34k
        }
146
        /* DO4 loop avoids GCC x86 register pressure from hoisted DO8/DO16 loads. */
147
7.63k
        while (len >= 4) {
148
2.86k
            if (COPY) {
149
2.86k
                memcpy(dst, buf, 4);
150
2.86k
                dst += 4;
151
2.86k
            }
152
2.86k
            len -= 4;
153
2.86k
            ADLER_DO4(adler, sum2, buf, 0);
154
2.86k
            buf += 4;
155
2.86k
        }
156
4.77k
        if (len & 2) {
157
2.92k
            if (COPY) {
158
2.92k
                memcpy(dst, buf, 2);
159
2.92k
                dst += 2;
160
2.92k
            }
161
2.92k
            ADLER_DO2(adler, sum2, buf, 0);
162
2.92k
            buf += 2;
163
2.92k
        }
164
4.77k
        if (len & 1) {
165
2.34k
            if (COPY)
166
2.34k
                *dst = *buf;
167
2.34k
            ADLER_DO1(adler, sum2, buf, 0);
168
2.34k
        }
169
4.77k
    }
170
4.77k
    if (REBASE) {
171
4.77k
        adler %= BASE;
172
4.77k
        sum2 %= BASE;
173
4.77k
    }
174
    /* D = B * 65536 + A, see: https://en.wikipedia.org/wiki/Adler-32. */
175
4.77k
    return adler | (sum2 << 16);
176
4.77k
}
adler32_avx2.c:adler32_copy_tail
Line
Count
Source
134
23.9k
                                                uint32_t sum2, const int REBASE, const int MAX_LEN, const int COPY) {
135
23.9k
    if (len) {
136
23.5k
        Z_UNUSED(MAX_LEN);
137
        /* Process using packed 64-bit arithmetic when source is aligned */
138
35.1k
        while (len >= 8 && ((uintptr_t)buf & 7) == 0) {
139
11.5k
            size_t chunk = MIN(ALIGN_DOWN(len, (size_t)8), (size_t)ADLER32_SWAR_MAX_BYTES);
140
11.5k
            adler32_swar(&adler, dst, buf, chunk, &sum2, COPY);
141
11.5k
            buf += chunk;
142
11.5k
            if (COPY)
143
2.93k
                dst += chunk;
144
11.5k
            len -= chunk;
145
11.5k
        }
146
        /* DO4 loop avoids GCC x86 register pressure from hoisted DO8/DO16 loads. */
147
34.0k
        while (len >= 4) {
148
10.4k
            if (COPY) {
149
3.47k
                memcpy(dst, buf, 4);
150
3.47k
                dst += 4;
151
3.47k
            }
152
10.4k
            len -= 4;
153
10.4k
            ADLER_DO4(adler, sum2, buf, 0);
154
10.4k
            buf += 4;
155
10.4k
        }
156
23.5k
        if (len & 2) {
157
12.9k
            if (COPY) {
158
3.47k
                memcpy(dst, buf, 2);
159
3.47k
                dst += 2;
160
3.47k
            }
161
12.9k
            ADLER_DO2(adler, sum2, buf, 0);
162
12.9k
            buf += 2;
163
12.9k
        }
164
23.5k
        if (len & 1) {
165
11.7k
            if (COPY)
166
3.21k
                *dst = *buf;
167
11.7k
            ADLER_DO1(adler, sum2, buf, 0);
168
11.7k
        }
169
23.5k
    }
170
23.9k
    if (REBASE) {
171
23.9k
        adler %= BASE;
172
23.9k
        sum2 %= BASE;
173
23.9k
    }
174
    /* D = B * 65536 + A, see: https://en.wikipedia.org/wiki/Adler-32. */
175
23.9k
    return adler | (sum2 << 16);
176
23.9k
}
Unexecuted instantiation: adler32_avx2_vnni.c:adler32_copy_tail
Unexecuted instantiation: adler32_avx512.c:adler32_copy_tail
Unexecuted instantiation: adler32_avx512_vnni.c:adler32_copy_tail
Unexecuted instantiation: adler32_c.c:adler32_copy_tail
177
178
#endif /* ADLER32_P_H */