Coverage Report

Created: 2026-07-12 06:46

next uncovered line (L), next uncovered region (R), next uncovered branch (B)
/src/xpdf-4.06/xpdf/CharCodeToUnicode.cc
Line
Count
Source
1
//========================================================================
2
//
3
// CharCodeToUnicode.cc
4
//
5
// Copyright 2001-2003 Glyph & Cog, LLC
6
//
7
//========================================================================
8
9
#include <aconf.h>
10
11
#include <stdio.h>
12
#include <string.h>
13
#include "gmem.h"
14
#include "gmempp.h"
15
#include "gfile.h"
16
#include "GString.h"
17
#include "Error.h"
18
#include "GlobalParams.h"
19
#include "PSTokenizer.h"
20
#include "CharCodeToUnicode.h"
21
22
//------------------------------------------------------------------------
23
24
677k
#define maxUnicodeString 8
25
26
struct CharCodeToUnicodeString {
27
  CharCode c;
28
  Unicode u[maxUnicodeString];
29
  int len;
30
};
31
32
//------------------------------------------------------------------------
33
34
struct GStringIndex {
35
  GString *s;
36
  int i;
37
};
38
39
8.82M
static int getCharFromGString(void *data) {
40
8.82M
  GStringIndex *idx = (GStringIndex *)data;
41
8.82M
  if (idx->i >= idx->s->getLength()) {
42
14.3k
    return EOF;
43
14.3k
  }
44
8.80M
  return idx->s->getChar(idx->i++) & 0xff;
45
8.82M
}
46
47
0
static int getCharFromFile(void *data) {
48
0
  return fgetc((FILE *)data);
49
0
}
50
51
//------------------------------------------------------------------------
52
53
static int hexCharVals[256] = {
54
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 0x
55
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 1x
56
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 2x
57
   0,  1,  2,  3,  4,  5,  6,  7,  8,  9, -1, -1, -1, -1, -1, -1, // 3x
58
  -1, 10, 11, 12, 13, 14, 15, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 4x
59
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 5x
60
  -1, 10, 11, 12, 13, 14, 15, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 6x
61
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 7x
62
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 8x
63
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // 9x
64
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // Ax
65
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // Bx
66
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // Cx
67
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // Dx
68
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, // Ex
69
  -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1, -1  // Fx
70
};
71
72
// Parse a <len>-byte hex string <s> into *<val>.  Returns false on
73
// error.
74
941k
static GBool parseHex(char *s, int len, Guint *val) {
75
941k
  int i, x;
76
77
941k
  *val = 0;
78
4.17M
  for (i = 0; i < len; ++i) {
79
3.27M
    x = hexCharVals[s[i] & 0xff];
80
3.27M
    if (x < 0) {
81
37.7k
      return gFalse;
82
37.7k
    }
83
3.23M
    *val = (*val << 4) + x;
84
3.23M
  }
85
903k
  return gTrue;
86
941k
}
87
88
//------------------------------------------------------------------------
89
90
6.79k
CharCodeToUnicode *CharCodeToUnicode::makeIdentityMapping() {
91
6.79k
  return new CharCodeToUnicode();
92
6.79k
}
93
94
CharCodeToUnicode *CharCodeToUnicode::parseCIDToUnicode(GString *fileName,
95
0
              GString *collection) {
96
0
  FILE *f;
97
0
  Unicode *mapA;
98
0
  CharCode size, mapLenA;
99
0
  char buf[64];
100
0
  Unicode u;
101
0
  CharCodeToUnicode *ctu;
102
103
0
  if (!(f = openFile(fileName->getCString(), "r"))) {
104
0
    error(errSyntaxError, -1, "Couldn't open cidToUnicode file '{0:t}'",
105
0
    fileName);
106
0
    return NULL;
107
0
  }
108
109
0
  size = 32768;
110
0
  mapA = (Unicode *)gmallocn(size, sizeof(Unicode));
111
0
  mapLenA = 0;
112
113
0
  while (getLine(buf, sizeof(buf), f)) {
114
0
    if (mapLenA == size) {
115
0
      size *= 2;
116
0
      mapA = (Unicode *)greallocn(mapA, size, sizeof(Unicode));
117
0
    }
118
0
    if (sscanf(buf, "%x", &u) == 1) {
119
0
      mapA[mapLenA] = u;
120
0
    } else {
121
0
      error(errSyntaxWarning, -1,
122
0
      "Bad line ({0:d}) in cidToUnicode file '{1:t}'",
123
0
      (int)(mapLenA + 1), fileName);
124
0
      mapA[mapLenA] = 0;
125
0
    }
126
0
    ++mapLenA;
127
0
  }
128
0
  fclose(f);
129
130
0
  ctu = new CharCodeToUnicode(collection->copy(), mapA, mapLenA, gTrue,
131
0
            NULL, 0, 0);
132
0
  gfree(mapA);
133
0
  return ctu;
134
0
}
135
136
CharCodeToUnicode *CharCodeToUnicode::parseUnicodeToUnicode(
137
0
                GString *fileName) {
138
0
  FILE *f;
139
0
  Unicode *mapA;
140
0
  CharCodeToUnicodeString *sMapA;
141
0
  CharCode size, oldSize, len, sMapSizeA, sMapLenA;
142
0
  char buf[256];
143
0
  char *tok;
144
0
  Unicode u0;
145
0
  Unicode uBuf[maxUnicodeString];
146
0
  CharCodeToUnicode *ctu;
147
0
  int line, n, i;
148
149
0
  if (!(f = openFile(fileName->getCString(), "r"))) {
150
0
    error(errSyntaxError, -1, "Couldn't open unicodeToUnicode file '{0:t}'",
151
0
    fileName);
152
0
    return NULL;
153
0
  }
154
155
0
  size = 4096;
156
0
  mapA = (Unicode *)gmallocn(size, sizeof(Unicode));
157
0
  memset(mapA, 0, size * sizeof(Unicode));
158
0
  len = 0;
159
0
  sMapA = NULL;
160
0
  sMapSizeA = sMapLenA = 0;
161
162
0
  line = 0;
163
0
  while (getLine(buf, sizeof(buf), f)) {
164
0
    ++line;
165
0
    if (!(tok = strtok(buf, " \t\r\n")) ||
166
0
  !parseHex(tok, (int)strlen(tok), &u0)) {
167
0
      error(errSyntaxWarning, -1,
168
0
      "Bad line ({0:d}) in unicodeToUnicode file '{1:t}'",
169
0
      line, fileName);
170
0
      continue;
171
0
    }
172
0
    n = 0;
173
0
    while (n < maxUnicodeString) {
174
0
      if (!(tok = strtok(NULL, " \t\r\n"))) {
175
0
  break;
176
0
      }
177
0
      if (!parseHex(tok, (int)strlen(tok), &uBuf[n])) {
178
0
  error(errSyntaxWarning, -1,
179
0
        "Bad line ({0:d}) in unicodeToUnicode file '{1:t}'",
180
0
        line, fileName);
181
0
  break;
182
0
      }
183
0
      ++n;
184
0
    }
185
0
    if (n < 1) {
186
0
      error(errSyntaxWarning, -1,
187
0
      "Bad line ({0:d}) in unicodeToUnicode file '{1:t}'",
188
0
      line, fileName);
189
0
      continue;
190
0
    }
191
0
    if (u0 >= size) {
192
0
      oldSize = size;
193
0
      while (u0 >= size) {
194
0
  size *= 2;
195
0
      }
196
0
      mapA = (Unicode *)greallocn(mapA, size, sizeof(Unicode));
197
0
      memset(mapA + oldSize, 0, (size - oldSize) * sizeof(Unicode));
198
0
    }
199
0
    if (n == 1) {
200
0
      mapA[u0] = uBuf[0];
201
0
    } else {
202
0
      mapA[u0] = 0;
203
0
      if (sMapLenA == sMapSizeA) {
204
0
  sMapSizeA += 16;
205
0
  sMapA = (CharCodeToUnicodeString *)
206
0
            greallocn(sMapA, sMapSizeA, sizeof(CharCodeToUnicodeString));
207
0
      }
208
0
      sMapA[sMapLenA].c = u0;
209
0
      for (i = 0; i < n; ++i) {
210
0
  sMapA[sMapLenA].u[i] = uBuf[i];
211
0
      }
212
0
      sMapA[sMapLenA].len = n;
213
0
      ++sMapLenA;
214
0
    }
215
0
    if (u0 >= len) {
216
0
      len = u0 + 1;
217
0
    }
218
0
  }
219
0
  fclose(f);
220
221
0
  ctu = new CharCodeToUnicode(fileName->copy(), mapA, len, gTrue,
222
0
            sMapA, sMapLenA, sMapSizeA);
223
0
  gfree(mapA);
224
0
  return ctu;
225
0
}
226
227
44.5k
CharCodeToUnicode *CharCodeToUnicode::make8BitToUnicode(Unicode *toUnicode) {
228
44.5k
  return new CharCodeToUnicode(NULL, toUnicode, 256, gTrue, NULL, 0, 0);
229
44.5k
}
230
231
0
CharCodeToUnicode *CharCodeToUnicode::make16BitToUnicode(Unicode *toUnicode) {
232
0
  return new CharCodeToUnicode(NULL, toUnicode, 65536, gTrue, NULL, 0, 0);
233
0
}
234
235
1.61k
CharCodeToUnicode *CharCodeToUnicode::parseCMap(GString *buf, int nBits) {
236
1.61k
  CharCodeToUnicode *ctu;
237
1.61k
  GStringIndex idx;
238
239
1.61k
  ctu = new CharCodeToUnicode(NULL);
240
1.61k
  idx.s = buf;
241
1.61k
  idx.i = 0;
242
1.61k
  if (!ctu->parseCMap1(&getCharFromGString, &idx, nBits)) {
243
931
    delete ctu;
244
931
    return NULL;
245
931
  }
246
682
  return ctu;
247
1.61k
}
248
249
6.03k
void CharCodeToUnicode::mergeCMap(GString *buf, int nBits) {
250
6.03k
  GStringIndex idx;
251
252
6.03k
  idx.s = buf;
253
6.03k
  idx.i = 0;
254
6.03k
  parseCMap1(&getCharFromGString, &idx, nBits);
255
6.03k
}
256
257
GBool CharCodeToUnicode::parseCMap1(int (*getCharFunc)(void *), void *data,
258
7.64k
            int nBits) {
259
7.64k
  PSTokenizer *pst;
260
7.64k
  char tok1[256], tok2[256], tok3[256];
261
7.64k
  int n1, n2, n3;
262
7.64k
  CharCode i;
263
7.64k
  CharCode maxCode, code1, code2;
264
7.64k
  GString *name;
265
7.64k
  FILE *f;
266
7.64k
  GBool ok;
267
268
7.64k
  ok = gFalse;
269
7.64k
  maxCode = (nBits == 8) ? 0xff : (nBits == 16) ? 0xffff : 0xffffffff;
270
7.64k
  pst = new PSTokenizer(getCharFunc, data);
271
7.64k
  pst->getToken(tok1, sizeof(tok1), &n1);
272
239k
  while (pst->getToken(tok2, sizeof(tok2), &n2)) {
273
231k
    if (!strcmp(tok1, "begincodespacerange")) {
274
4.05k
      if (globalParams->getIgnoreWrongSizeToUnicode() &&
275
0
    tok2[0] == '<' && tok2[n2 - 1] == '>' &&
276
0
    n2 - 2 != nBits / 4) {
277
0
  error(errSyntaxWarning, -1,
278
0
        "Incorrect character size in ToUnicode CMap");
279
0
  ok = gFalse;
280
0
  break;
281
0
      }
282
22.5k
      while (pst->getToken(tok1, sizeof(tok1), &n1) &&
283
22.3k
       strcmp(tok1, "endcodespacerange")) ;
284
227k
    } else if (!strcmp(tok2, "usecmap")) {
285
0
      if (tok1[0] == '/') {
286
0
  name = new GString(tok1 + 1);
287
0
  if ((f = globalParams->findToUnicodeFile(name))) {
288
0
    if (parseCMap1(&getCharFromFile, f, nBits)) {
289
0
      ok = gTrue;
290
0
    }
291
0
    fclose(f);
292
0
  } else {
293
0
    error(errSyntaxError, -1,
294
0
    "Couldn't find ToUnicode CMap file for '{1:t}'",
295
0
    name);
296
0
  }
297
0
  delete name;
298
0
      }
299
0
      pst->getToken(tok1, sizeof(tok1), &n1);
300
227k
    } else if (!strcmp(tok2, "beginbfchar")) {
301
250k
      while (pst->getToken(tok1, sizeof(tok1), &n1)) {
302
250k
  if (!strcmp(tok1, "endbfchar")) {
303
2.09k
    break;
304
2.09k
  }
305
248k
  if (!pst->getToken(tok2, sizeof(tok2), &n2) ||
306
248k
      !strcmp(tok2, "endbfchar")) {
307
430
    error(errSyntaxWarning, -1,
308
430
    "Illegal entry in bfchar block in ToUnicode CMap");
309
430
    break;
310
430
  }
311
247k
  if (!(tok1[0] == '<' && tok1[n1 - 1] == '>' &&
312
209k
        tok2[0] == '<' && tok2[n2 - 1] == '>')) {
313
45.3k
    error(errSyntaxWarning, -1,
314
45.3k
    "Illegal entry in bfchar block in ToUnicode CMap");
315
45.3k
    continue;
316
45.3k
  }
317
202k
  tok1[n1 - 1] = tok2[n2 - 1] = '\0';
318
202k
  if (!parseHex(tok1 + 1, n1 - 2, &code1)) {
319
6.53k
    error(errSyntaxWarning, -1,
320
6.53k
    "Illegal entry in bfchar block in ToUnicode CMap");
321
6.53k
    continue;
322
6.53k
  }
323
195k
  if (code1 > maxCode) {
324
1.90k
    error(errSyntaxWarning, -1,
325
1.90k
    "Invalid entry in bfchar block in ToUnicode CMap");
326
1.90k
  }
327
195k
  addMapping(code1, tok2 + 1, n2 - 2, 0);
328
195k
  ok = gTrue;
329
195k
      }
330
2.86k
      pst->getToken(tok1, sizeof(tok1), &n1);
331
224k
    } else if (!strcmp(tok2, "beginbfrange")) {
332
31.1k
      while (pst->getToken(tok1, sizeof(tok1), &n1)) {
333
30.9k
  if (!strcmp(tok1, "endbfrange")) {
334
967
    break;
335
967
  }
336
29.9k
  if (!pst->getToken(tok2, sizeof(tok2), &n2) ||
337
29.9k
      !strcmp(tok2, "endbfrange") ||
338
29.8k
      !pst->getToken(tok3, sizeof(tok3), &n3) ||
339
29.7k
      !strcmp(tok3, "endbfrange")) {
340
232
    error(errSyntaxWarning, -1,
341
232
    "Illegal entry in bfrange block in ToUnicode CMap");
342
232
    break;
343
232
  }
344
29.7k
  if (!(tok1[0] == '<' && tok1[n1 - 1] == '>' &&
345
18.0k
        tok2[0] == '<' && tok2[n2 - 1] == '>')) {
346
18.0k
    error(errSyntaxWarning,
347
18.0k
    -1, "Illegal entry in bfrange block in ToUnicode CMap");
348
18.0k
    continue;
349
18.0k
  }
350
11.6k
  tok1[n1 - 1] = tok2[n2 - 1] = '\0';
351
11.6k
  if (!parseHex(tok1 + 1, n1 - 2, &code1) ||
352
10.3k
      !parseHex(tok2 + 1, n2 - 2, &code2)) {
353
1.90k
    error(errSyntaxWarning, -1,
354
1.90k
    "Illegal entry in bfrange block in ToUnicode CMap");
355
1.90k
    continue;
356
1.90k
  }
357
9.76k
  if (code1 > maxCode || code2 > maxCode) {
358
2.07k
    error(errSyntaxWarning, -1,
359
2.07k
    "Invalid entry in bfrange block in ToUnicode CMap");
360
2.07k
    if (code2 > maxCode) {
361
1.60k
      code2 = maxCode;
362
1.60k
    }
363
2.07k
  }
364
9.76k
  if (!strcmp(tok3, "[")) {
365
469
    i = 0;
366
4.99k
    while (pst->getToken(tok1, sizeof(tok1), &n1)) {
367
4.99k
      if (!strcmp(tok1, "]")) {
368
461
        break;
369
461
      }
370
4.53k
      if (tok1[0] == '<' && tok1[n1 - 1] == '>') {
371
1.76k
        if (code1 + i <= code2) {
372
445
    tok1[n1 - 1] = '\0';
373
445
    addMapping(code1 + i, tok1 + 1, n1 - 2, 0);
374
445
    ok = gTrue;
375
445
        }
376
2.76k
      } else {
377
2.76k
        error(errSyntaxWarning, -1,
378
2.76k
        "Illegal entry in bfrange block in ToUnicode CMap");
379
2.76k
      }
380
4.53k
      ++i;
381
4.53k
    }
382
9.29k
  } else if (tok3[0] == '<' && tok3[n3 - 1] == '>') {
383
8.54k
    tok3[n3 - 1] = '\0';
384
444k
    for (i = 0; code1 <= code2; ++code1, ++i) {
385
435k
      addMapping(code1, tok3 + 1, n3 - 2, i);
386
435k
      ok = gTrue;
387
435k
    }
388
8.54k
  } else {
389
757
    error(errSyntaxWarning, -1,
390
757
    "Illegal entry in bfrange block in ToUnicode CMap");
391
757
  }
392
9.76k
      }
393
1.36k
      pst->getToken(tok1, sizeof(tok1), &n1);
394
223k
    } else if (!strcmp(tok2, "begincidchar")) {
395
      // the begincidchar operator is not allowed in ToUnicode CMaps,
396
      // but some buggy PDF generators incorrectly use
397
      // code-to-CID-type CMaps here
398
124
      error(errSyntaxWarning, -1,
399
124
      "Invalid 'begincidchar' operator in ToUnicode CMap");
400
5.29k
      while (pst->getToken(tok1, sizeof(tok1), &n1)) {
401
5.28k
  if (!strcmp(tok1, "endcidchar")) {
402
66
    break;
403
66
  }
404
5.21k
  if (!pst->getToken(tok2, sizeof(tok2), &n2) ||
405
5.20k
      !strcmp(tok2, "endcidchar")) {
406
42
    error(errSyntaxWarning, -1,
407
42
    "Illegal entry in cidchar block in ToUnicode CMap");
408
42
    break;
409
42
  }
410
5.17k
  if (!(tok1[0] == '<' && tok1[n1 - 1] == '>')) {
411
1.62k
    error(errSyntaxWarning, -1,
412
1.62k
    "Illegal entry in cidchar block in ToUnicode CMap");
413
1.62k
    continue;
414
1.62k
  }
415
3.55k
  tok1[n1 - 1] = '\0';
416
3.55k
  if (!parseHex(tok1 + 1, n1 - 2, &code1)) {
417
226
    error(errSyntaxWarning, -1,
418
226
    "Illegal entry in cidchar block in ToUnicode CMap");
419
226
    continue;
420
226
  }
421
3.32k
  if (code1 > maxCode) {
422
642
    error(errSyntaxWarning, -1,
423
642
    "Invalid entry in cidchar block in ToUnicode CMap");
424
642
  }
425
3.32k
  addMappingInt(code1, atoi(tok2));
426
3.32k
  ok = gTrue;
427
3.32k
      }
428
124
      pst->getToken(tok1, sizeof(tok1), &n1);
429
223k
    } else if (!strcmp(tok2, "begincidrange")) {
430
      // the begincidrange operator is not allowed in ToUnicode CMaps,
431
      // but some buggy PDF generators incorrectly use
432
      // code-to-CID-type CMaps here
433
141
      error(errSyntaxWarning, -1,
434
141
      "Invalid 'begincidrange' operator in ToUnicode CMap");
435
14.2k
      while (pst->getToken(tok1, sizeof(tok1), &n1)) {
436
14.2k
  if (!strcmp(tok1, "endcidrange")) {
437
73
    break;
438
73
  }
439
14.1k
  if (!pst->getToken(tok2, sizeof(tok2), &n2) ||
440
14.1k
      !strcmp(tok2, "endcidrange") ||
441
14.1k
      !pst->getToken(tok3, sizeof(tok3), &n3) ||
442
14.0k
      !strcmp(tok3, "endcidrange")) {
443
50
    error(errSyntaxWarning, -1,
444
50
    "Illegal entry in cidrange block in ToUnicode CMap");
445
50
    break;
446
50
  }
447
14.0k
  if (!(tok1[0] == '<' && tok1[n1 - 1] == '>' &&
448
9.27k
        tok2[0] == '<' && tok2[n2 - 1] == '>')) {
449
9.27k
    error(errSyntaxWarning,
450
9.27k
    -1, "Illegal entry in cidrange block in ToUnicode CMap");
451
9.27k
    continue;
452
9.27k
  }
453
4.81k
  tok1[n1 - 1] = tok2[n2 - 1] = '\0';
454
4.81k
  if (!parseHex(tok1 + 1, n1 - 2, &code1) ||
455
3.66k
      !parseHex(tok2 + 1, n2 - 2, &code2)) {
456
1.52k
    error(errSyntaxWarning, -1,
457
1.52k
    "Illegal entry in cidrange block in ToUnicode CMap");
458
1.52k
    continue;
459
1.52k
  }
460
3.28k
  if (code1 > maxCode || code2 > maxCode) {
461
1.77k
    error(errSyntaxWarning, -1,
462
1.77k
    "Invalid entry in cidrange block in ToUnicode CMap");
463
1.77k
    if (code2 > maxCode) {
464
1.66k
      code2 = maxCode;
465
1.66k
    }
466
1.77k
  }
467
743k
  for (i = atoi(tok3); code1 <= code2; ++code1, ++i) {
468
740k
    addMappingInt(code1, i);
469
740k
    ok = gTrue;
470
740k
  }
471
3.28k
      }
472
141
      pst->getToken(tok1, sizeof(tok1), &n1);
473
223k
    } else {
474
223k
      strcpy(tok1, tok2);
475
223k
      n1 = n2;
476
223k
    }
477
231k
  }
478
7.64k
  delete pst;
479
7.64k
  return ok;
480
7.64k
}
481
482
void CharCodeToUnicode::addMapping(CharCode code, char *uStr, int n,
483
632k
           int offset) {
484
632k
  CharCode oldLen, i;
485
632k
  Unicode u[maxUnicodeString];
486
632k
  int uLen, j;
487
488
632k
  if (code > 0xffffff) {
489
    // This is an arbitrary limit to avoid integer overflow issues.
490
    // (I've seen CMaps with mappings for <ffffffff>.)
491
214
    return;
492
214
  }
493
631k
  if ((uLen = parseUTF16String(uStr, n, u)) == 0) {
494
28.4k
    return;
495
28.4k
  }
496
603k
  if (code >= mapLen) {
497
299
    oldLen = mapLen;
498
299
    mapLen = mapLen ? 2 * mapLen : 256;
499
299
    if (code >= mapLen) {
500
198
      mapLen = (code + 256) & ~255;
501
198
    }
502
299
    map = (Unicode *)greallocn(map, mapLen, sizeof(Unicode));
503
114M
    for (i = oldLen; i < mapLen; ++i) {
504
114M
      map[i] = 0;
505
114M
    }
506
299
  }
507
603k
  if (uLen == 1) {
508
576k
    map[code] = u[0] + offset;
509
576k
  } else {
510
26.7k
    if (sMapLen >= sMapSize) {
511
2.01k
      sMapSize = sMapSize + 16;
512
2.01k
      sMap = (CharCodeToUnicodeString *)
513
2.01k
         greallocn(sMap, sMapSize, sizeof(CharCodeToUnicodeString));
514
2.01k
    }
515
26.7k
    map[code] = 0;
516
26.7k
    sMap[sMapLen].c = code;
517
105k
    for (j = 0; j < uLen; ++j) {
518
78.8k
      sMap[sMapLen].u[j] = u[j];
519
78.8k
    }
520
26.7k
    sMap[sMapLen].u[uLen - 1] += offset;
521
26.7k
    sMap[sMapLen].len = uLen;
522
26.7k
    ++sMapLen;
523
26.7k
  }
524
603k
}
525
526
// Convert a UTF-16BE hex string into a sequence of up to
527
// maxUnicodeString Unicode chars.
528
631k
int CharCodeToUnicode::parseUTF16String(char *uStr, int n, Unicode *uOut) {
529
631k
  int i = 0;
530
631k
  int uLen = 0;
531
1.30M
  while (i < n) {
532
705k
    Unicode u;
533
705k
    int j = n;
534
705k
    if (j - i > 4) {
535
98.9k
      j = i + 4;
536
98.9k
    }
537
705k
    if (!parseHex(uStr + i, j - i, &u)) {
538
27.5k
      error(errSyntaxWarning, -1, "Illegal entry in ToUnicode CMap");
539
27.5k
      return 0;
540
27.5k
    }
541
    // look for a UTF-16 pair
542
677k
    if (uLen > 0 && uOut[uLen-1] >= 0xd800 && uOut[uLen-1] <= 0xdbff &&
543
846
  u >= 0xdc00 && u <= 0xdfff) {
544
58
      uOut[uLen-1] = 0x10000 + ((uOut[uLen-1] & 0x03ff) << 10) + (u & 0x03ff);
545
677k
    } else {
546
677k
      if (uLen < maxUnicodeString) {
547
675k
  uOut[uLen++] = u;
548
675k
      }
549
677k
    }
550
677k
    i = j;
551
677k
  }
552
604k
  return uLen;
553
631k
}
554
555
743k
void CharCodeToUnicode::addMappingInt(CharCode code, Unicode u) {
556
743k
  CharCode oldLen, i;
557
558
743k
  if (code > 0xffffff) {
559
    // This is an arbitrary limit to avoid integer overflow issues.
560
    // (I've seen CMaps with mappings for <ffffffff>.)
561
12
    return;
562
12
  }
563
743k
  if (code >= mapLen) {
564
355
    oldLen = mapLen;
565
355
    mapLen = mapLen ? 2 * mapLen : 256;
566
355
    if (code >= mapLen) {
567
239
      mapLen = (code + 256) & ~255;
568
239
    }
569
355
    map = (Unicode *)greallocn(map, mapLen, sizeof(Unicode));
570
11.4M
    for (i = oldLen; i < mapLen; ++i) {
571
11.4M
      map[i] = 0;
572
11.4M
    }
573
355
  }
574
743k
  map[code] = u;
575
743k
}
576
577
6.79k
CharCodeToUnicode::CharCodeToUnicode() {
578
6.79k
  tag = NULL;
579
6.79k
  map = NULL;
580
6.79k
  mapLen = 0;
581
6.79k
  sMap = NULL;
582
6.79k
  sMapLen = sMapSize = 0;
583
6.79k
  refCnt = 1;
584
6.79k
}
585
586
1.61k
CharCodeToUnicode::CharCodeToUnicode(GString *tagA) {
587
1.61k
  CharCode i;
588
589
1.61k
  tag = tagA;
590
1.61k
  mapLen = 256;
591
1.61k
  map = (Unicode *)gmallocn(mapLen, sizeof(Unicode));
592
414k
  for (i = 0; i < mapLen; ++i) {
593
412k
    map[i] = 0;
594
412k
  }
595
1.61k
  sMap = NULL;
596
1.61k
  sMapLen = sMapSize = 0;
597
1.61k
  refCnt = 1;
598
1.61k
}
599
600
CharCodeToUnicode::CharCodeToUnicode(GString *tagA, Unicode *mapA,
601
             CharCode mapLenA, GBool copyMap,
602
             CharCodeToUnicodeString *sMapA,
603
44.5k
             int sMapLenA, int sMapSizeA) {
604
44.5k
  tag = tagA;
605
44.5k
  mapLen = mapLenA;
606
44.5k
  if (copyMap) {
607
44.5k
    map = (Unicode *)gmallocn(mapLen, sizeof(Unicode));
608
44.5k
    memcpy(map, mapA, mapLen * sizeof(Unicode));
609
44.5k
  } else {
610
0
    map = mapA;
611
0
  }
612
44.5k
  sMap = sMapA;
613
44.5k
  sMapLen = sMapLenA;
614
44.5k
  sMapSize = sMapSizeA;
615
44.5k
  refCnt = 1;
616
44.5k
}
617
618
52.9k
CharCodeToUnicode::~CharCodeToUnicode() {
619
52.9k
  if (tag) {
620
0
    delete tag;
621
0
  }
622
52.9k
  gfree(map);
623
52.9k
  gfree(sMap);
624
52.9k
}
625
626
0
void CharCodeToUnicode::incRefCnt() {
627
0
#if MULTITHREADED
628
0
  gAtomicIncrement(&refCnt);
629
#else
630
  ++refCnt;
631
#endif
632
0
}
633
634
51.9k
void CharCodeToUnicode::decRefCnt() {
635
51.9k
  GBool done;
636
637
51.9k
#if MULTITHREADED
638
51.9k
  done = gAtomicDecrement(&refCnt) == 0;
639
#else
640
  done = --refCnt == 0;
641
#endif
642
51.9k
  if (done) {
643
51.9k
    delete this;
644
51.9k
  }
645
51.9k
}
646
647
0
GBool CharCodeToUnicode::match(GString *tagA) {
648
0
  return tag && !tag->cmp(tagA);
649
0
}
650
651
0
void CharCodeToUnicode::setMapping(CharCode c, Unicode *u, int len) {
652
0
  int i, j;
653
654
0
  if (!map) {
655
0
    return;
656
0
  }
657
0
  if (len == 1) {
658
0
    map[c] = u[0];
659
0
  } else {
660
0
    for (i = 0; i < sMapLen; ++i) {
661
0
      if (sMap[i].c == c) {
662
0
  break;
663
0
      }
664
0
    }
665
0
    if (i == sMapLen) {
666
0
      if (sMapLen == sMapSize) {
667
0
  sMapSize += 8;
668
0
  sMap = (CharCodeToUnicodeString *)
669
0
           greallocn(sMap, sMapSize, sizeof(CharCodeToUnicodeString));
670
0
      }
671
0
      ++sMapLen;
672
0
    }
673
0
    map[c] = 0;
674
0
    sMap[i].c = c;
675
0
    sMap[i].len = len;
676
0
    for (j = 0; j < len && j < maxUnicodeString; ++j) {
677
0
      sMap[i].u[j] = u[j];
678
0
    }
679
0
  }
680
0
}
681
682
5.40M
int CharCodeToUnicode::mapToUnicode(CharCode c, Unicode *u, int size) {
683
5.40M
  int i, j;
684
685
5.40M
  if (!map) {
686
143k
    u[0] = (Unicode)c;
687
143k
    return 1;
688
143k
  }
689
5.25M
  if (c >= mapLen) {
690
8.46k
    return 0;
691
8.46k
  }
692
5.25M
  if (map[c]) {
693
3.75M
    u[0] = map[c];
694
3.75M
    return 1;
695
3.75M
  }
696
1.62M
  for (i = 0; i < sMapLen; ++i) {
697
128k
    if (sMap[i].c == c) {
698
2.75k
      for (j = 0; j < sMap[i].len && j < size; ++j) {
699
1.89k
  u[j] = sMap[i].u[j];
700
1.89k
      }
701
857
      return j;
702
857
    }
703
128k
  }
704
1.49M
  return 0;
705
1.50M
}
706
707
//------------------------------------------------------------------------
708
709
45.3k
CharCodeToUnicodeCache::CharCodeToUnicodeCache(int sizeA) {
710
45.3k
  int i;
711
712
45.3k
  size = sizeA;
713
45.3k
  cache = (CharCodeToUnicode **)gmallocn(size, sizeof(CharCodeToUnicode *));
714
226k
  for (i = 0; i < size; ++i) {
715
181k
    cache[i] = NULL;
716
181k
  }
717
45.3k
}
718
719
45.3k
CharCodeToUnicodeCache::~CharCodeToUnicodeCache() {
720
45.3k
  int i;
721
722
226k
  for (i = 0; i < size; ++i) {
723
181k
    if (cache[i]) {
724
0
      cache[i]->decRefCnt();
725
0
    }
726
181k
  }
727
45.3k
  gfree(cache);
728
45.3k
}
729
730
5.69k
CharCodeToUnicode *CharCodeToUnicodeCache::getCharCodeToUnicode(GString *tag) {
731
5.69k
  CharCodeToUnicode *ctu;
732
5.69k
  int i, j;
733
734
5.69k
  if (cache[0] && cache[0]->match(tag)) {
735
0
    cache[0]->incRefCnt();
736
0
    return cache[0];
737
0
  }
738
22.7k
  for (i = 1; i < size; ++i) {
739
17.0k
    if (cache[i] && cache[i]->match(tag)) {
740
0
      ctu = cache[i];
741
0
      for (j = i; j >= 1; --j) {
742
0
  cache[j] = cache[j - 1];
743
0
      }
744
0
      cache[0] = ctu;
745
0
      ctu->incRefCnt();
746
0
      return ctu;
747
0
    }
748
17.0k
  }
749
5.69k
  return NULL;
750
5.69k
}
751
752
0
void CharCodeToUnicodeCache::add(CharCodeToUnicode *ctu) {
753
0
  int i;
754
755
0
  if (cache[size - 1]) {
756
0
    cache[size - 1]->decRefCnt();
757
0
  }
758
0
  for (i = size - 1; i >= 1; --i) {
759
0
    cache[i] = cache[i - 1];
760
0
  }
761
0
  cache[0] = ctu;
762
0
  ctu->incRefCnt();
763
0
}