Skip to content
Last updated

Supported Values for Charset Option in CSV Parser

The following character encodings are supported with the charset option in the CSV Parser.

NameAliasesDescription
Big5csBig5Big5, Traditional Chinese
Big5-HKSCSbig5-hkscs, big5hk, Big5_HKSCS, big5hkscsBig5 with Hong Kong extensions, Traditional Chinese (incorporating 2001 revision)
CESU-8CESU8, csCESU-8Unicode CESU-8
EUC-JPcsEUCPkdFmtjapanese, x-euc-jp, eucjis, Extended_UNIX_Code_Packed_Format_for_Japanese, euc_jp, eucjp, x-eucjpJISX 0201, 0208 and 0212, EUC encoding Japanese
EUC-KRksc5601-1987, csEUCKR, ksc5601_1987, ksc5601, 5601, euc_kr, ksc_5601, ks_c_5601-1987, euckrKS C 5601, EUC encoding, Korean
GB18030gb18030-2000Simplified Chinese, PRC standard
GB2312gb2312, euc-cn, x-EUC-CN, euccn, EUC_CN, gb2312-80, gb2312-1980GB2312, EUC encoding, Simplified Chinese
GBKCP936, windows-936GBK, Simplified Chinese
IBM-Thaiibm-838, ibm838, 838, cp838IBM Thailand extended SBCS
IBM00858cp858, 858, PC-Multilingual-850+euro, cp00858, ccsid00858Variant of Cp850 with Euro character
IBM01140cp1140, 1140, cp01140, ebcdic-us-037+euro, ccsid01140Variant of Cp037 with Euro character
IBM011411141, cp1141, cp01141, ccsid01141, ebcdic-de-273+euroVariant of Cp273 with Euro character
IBM01142xyz1142, cp1142, cp01142, ccsid01142, ebcdic-no-277+euro, ebcdic-dk-277+euroVariant of Cp277 with Euro character
IBM011431143, cp01143, ccsid01143, cp1143, ebcdic-fi-278+euro, ebcdic-se-278+euroVariant of Cp278 with Euro character
IBM01144cp01144, ccsid01144, ebcdic-it-280+euro, cp1144, 1144Variant of Cp280 with Euro character
IBM01145ccsid01145, ebcdic-es-284+euro, 1145, cp1145, cp01145Variant of Cp284 with Euro character
IBM01146ebcdic-gb-285+euro, 1146, cp1146, cp01146, ccsid01146Variant of Cp285 with Euro character
IBM01147cp1147, 1147, cp01147, ccsid01147, ebcdic-fr-277+euroVariant of Cp297 with Euro character
IBM01148cp1148, ebcdic-international-500+euro, 1148, cp01148, ccsid01148Variant of Cp500 with Euro character
IBM01149ebcdic-s-871+euro, 1149, cp1149, cp01149, ccsid01149Variant of Cp871 with Euro character
IBM037cp037, ibm037, ibm-037, csIBM037, ebcdic-cp-us, ebcdic-cp-ca, ebcdic-cp-nl, ebcdic-cp-wt, 037, cpibm37, cs-ebcdic-cp-wt, ibm-37, cs-ebcdic-cp-us, cs-ebcdic-cp-ca, cs-ebcdic-cp-nlUSA, Canada (Bilingual, French), Netherlands, Portugal, Brazil, Australia
IBM1026cp1026, ibm-1026, 1026, ibm1026IBM Latin-5, Turkey
IBM1047ibm-1047, 1047, cp1047Latin-1 character set for EBCDIC hosts
IBM273ibm-273, ibm273, 273, cp273IBM Austria, Germany
IBM277ibm277, 277, cp277, ibm-277IBM Denmark, Norway
IBM278cp278, 278, ibm-278, ebcdic-cp-se, csIBM278, ibm278, ebcdic-svIBM Finland, Sweden
IBM280ibm280, 280, cp280, ibm-280IBM Italy
IBM284csIBM284, ibm-284, cpibm284, ibm284, 284, cp284IBM Catalan/Spain, Spanish Latin America
IBM285csIBM285, cp285, ebcdic-gb, ibm-285, cpibm285, ibm285, 285, ebcdic-cp-gbIBM United Kingdom, Ireland
IBM290ibm290, 290, cp290, EBCDIC-JP-kana, csIBM290, ibm-290IBM Japanese Katakana Host Extended SBCS
IBM297297, csIBM297, cp297, ibm297, ibm-297, cpibm297, ebcdic-cp-frIBM France
IBM420ibm420, 420, cp420, csIBM420, ibm-420, ebcdic-cp-ar1IBM Arabic
IBM424ebcdic-cp-he, csIBM424, ibm-424, ibm424, 424, cp424IBM Hebrew
IBM437ibm437, 437, ibm-437, cspc8codepage437, cp437, windows-437MS-DOS United States, Australia, New Zealand, South Africa
IBM500ibm-500, ibm500, 500, ebcdic-cp-bh, ebcdic-cp-ch, csIBM500, cp500EBCDIC 500V1
IBM775ibm-775, ibm775, 775, cp775PC Baltic
IBM850cp850, cspc850multilingual, ibm850, 850, ibm-850MS-DOS Latin-1
IBM852csPCp852, ibm-852, ibm852, 852, cp852MS-DOS Latin-2
IBM855ibm855, 855, ibm-855, cp855, cspcp855IBM Cyrillic
IBM857ibm857, 857, cp857, csIBM857, ibm-857IBM Turkish
IBM860ibm860, 860, cp860, csIBM860, ibm-860MS-DOS Portuguese
IBM861cp861, ibm861, 861, ibm-861, cp-is, csIBM861MS-DOS Icelandic
IBM862csIBM862, cp862, ibm862, 862, cspc862latinhebrew, ibm-862PC Hebrew
IBM863csIBM863, ibm-863, ibm863, 863, cp863MS-DOS Canadian French
IBM864csIBM864, ibm-864, ibm864, 864, cp864PC Arabic
IBM865ibm-865, csIBM865, cp865, ibm865, 865MS-DOS Nordic
IBM866ibm866, 866, ibm-866, csIBM866, cp866MS-DOS Russian
IBM868ibm868, 868, cp868, csIBM868, ibm-868, cp-arMS-DOS Pakistan
IBM869cp869, ibm869, 869, ibm-869, cp-gr, csIBM869IBM Modern Greek
IBM870870, cp870, csIBM870, ibm-870, ibm870, ebcdic-cp-roece, ebcdic-cp-yuIBM Multilingual Latin-2
IBM871ibm871, 871, cp871, ebcdic-cp-is, csIBM871, ibm-871IBM Iceland
IBM918918, ibm-918, ebcdic-cp-ar2, cp918IBM Pakistan (Urdu)
ISO-2022-CNcsISO2022CN, ISO2022CNGB2312 and CNS11643 in ISO 2022 CN form, Simplified and Traditional Chinese (conversion to Unicode only)
ISO-2022-JPcsjisencoding, iso2022jp, jis_encoding, jis, csISO2022JPJIS X 0201, 0208, in ISO 2022 form, Japanese
ISO-2022-JP-2csISO2022JP2, iso2022jp2JIS X 0201, 0208, 0212 in ISO 2022 form, Japanese
ISO-2022-KRcsISO2022KR, ISO2022KRISO 2022 KR, Korean
ISO-8859-1819, ISO8859-1, l1, ISO_8859-1:1987, ISO_8859-1, 8859_1, iso-ir-100, latin1, cp819, ISO8859_1, IBM819, ISO_8859_1, IBM-819, csISOLatin1ISO-8859-1, Latin Alphabet No. 1
ISO-8859-13iso_8859-13, ISO8859-13, iso8859_13, 8859_13Latin Alphabet No. 7
ISO-8859-15ISO8859-15, LATIN0, ISO8859_15_FDIS, ISO8859_15, cp923, 8859_15, L9, ISO-8859-15, IBM923, csISOlatin9, ISO_8859-15, IBM-923, csISOlatin0, 923, LATIN9Latin Alphabet No. 9
ISO-8859-2ISO8859-2, ibm912, l2, ISO_8859-2, 8859_2, cp912, ISO_8859-2:1987, iso8859_2, iso-ir-101, latin2, 912, csISOLatin2, ibm-912Latin Alphabet No. 2
ISO-8859-3ISO8859-3, ibm913, 8859_3, l3, cp913, ISO_8859-3, iso8859_3, latin3, csISOLatin3, 913, ISO_8859-3:1988, ibm-913, iso-ir-109Latin Alphabet No. 3
ISO-8859-48859_4, latin4, l4, cp914, ISO_8859-4:1988, ibm914, ISO_8859-4, iso-ir-110, iso8859_4, csISOLatin4, iso8859-4, 914, ibm-914Latin Alphabet No. 4
ISO-8859-5ISO_8859-5:1988, csISOLatinCyrillic, iso-ir-144, iso8859_5, cp915, 8859_5, ibm-915, ISO_8859-5, ibm915, 915, cyrillic, ISO8859-5Latin/Cyrillic Alphabet
ISO-8859-6ASMO-708, 8859_6, iso8859_6, ISO_8859-6, csISOLatinArabic, ibm1089, arabic, ibm-1089, 1089, ECMA-114, iso-ir-127, ISO_8859-6:1987, ISO8859-6, cp1089Latin/Arabic Alphabet
ISO-8859-7greek, 8859_7, greek8, ibm813, ISO_8859-7, iso8859_7, ELOT_928, cp813, ISO_8859-7:1987, sun_eu_greek, csISOLatinGreek, iso-ir-126, 813, iso8859-7, ECMA-118, ibm-813Latin/Greek Alphabet (ISO-8859-7:2003)
ISO-8859-88859_8, ISO_8859-8, ISO_8859-8:1988, cp916, iso-ir-138, ISO8859-8, hebrew, iso8859_8, ibm-916, csISOLatinHebrew, 916, ibm916Latin/Hebrew Alphabet
ISO-8859-9ibm-920, ISO_8859-9, 8859_9, ISO_8859-9:1989, ibm920, latin5, l5, iso8859_9, cp920, 920, iso-ir-148, ISO8859-9, csISOLatin5Latin Alphabet No. 5
JIS_X0201JIS0201, csHalfWidthKatakana, X0201, JIS_X0201JIS X 0201
JIS_X0212-1990JIS0212, iso-ir-159, x0212, jis_x0212-1990, csISO159JISX02121990JIS X 0212
KOI8-Rkoi8_r, koi8, cskoi8rKOI8-R, Russian
KOI8-Ukoi8_uKOI8-U, Ukrainian
Shift_JISshift_jis, x-sjis, sjis, shift-jis, ms_kanji, csShiftJISShift-JIS, Japanese
TIS-620tis620, tis620.2533TIS620, Thai
US-ASCIIANSI_X3.4-1968, cp367, csASCII, iso-ir-6, ASCII, iso_646.irv:1983, ANSI_X3.4-1986, ascii7, default, ISO_646.irv:1991, ISO646-US, IBM367, 646, usAmerican Standard Code for Information Interchange
UTF-16UTF_16, unicode, utf16, UnicodeBigSixteen-bit Unicode (or UCS) Transformation Format, byte order identified by an optional byte-order mark
UTF-16BEX-UTF-16BE, UTF_16BE, ISO-10646-UCS-2, UnicodeBigUnmarkedSixteen-bit Unicode (or UCS) Transformation Format, big-endian byte order
UTF-16LEUnicodeLittleUnmarked, UTF_16LE, X-UTF-16LESixteen-bit Unicode (or UCS) Transformation Format, little-endian byte order
UTF-32UTF_32, UTF3232-bit Unicode (or UCS) Transformation Format, byte order identified by an optional byte-order mark
UTF-32BEX-UTF-32BE, UTF_32BE32-bit Unicode (or UCS) Transformation Format, big-endian byte order
UTF-32LEX-UTF-32LE, UTF_32LE32-bit Unicode (or UCS) Transformation Format, little-endian byte order
UTF-8unicode-1-1-utf-8, UTF8Eight-bit Unicode (or UCS) Transformation Format
windows-1250cp1250, cp5346Windows Eastern European
windows-1251cp5347, ansi-1251, cp1251Windows Cyrillic
windows-1252cp5348, cp1252Windows Latin-1
windows-1253cp1253, cp5349Windows Greek
windows-1254cp1254, cp5350Windows Turkish
windows-1255cp1255Windows Hebrew
windows-1256cp1256Windows Arabic
windows-1257cp1257, cp5353Windows Baltic
windows-1258cp1258Windows Vietnamese
windows-31jMS932, windows-932, csWindows31JWindows Japanese
x-Big5-HKSCS-2001Big5_HKSCS_2001, big5-hkscs-2001, big5hk-2001, big5-hkscs:unicode3.0, big5hkscs-2001Big5 with Hong Kong Supplementary Character Set, 2001 revision
x-Big5-SolarisBig5_SolarisBig5 with seven additional Hanzi ideograph character mappings for the Solaris zh_TW.BIG5 locale
x-COMPOUND_TEXTCOMPOUND_TEXT, x-compound-text, x11-compound_textx-compound-text
x-euc-jp-linuxeuc_jp_linux, euc-jp-linuxJISX 0201, 0208, EUC encoding Japanese
x-EUC-TWeuctw, cns11643, EUC-TW, euc_twCNS11643 (Plane 1-7,15), EUC encoding, Traditional Chinese
x-eucJP-OpeneucJP-open, EUC_JP_SolarisJISX 0201, 0208, 0212, EUC encoding Japanese
x-IBM1006ibm1006, ibm-1006, 1006, cp1006IBM AIX Pakistan (Urdu)
x-IBM1025ibm-1025, 1025, cp1025, ibm1025IBM Multilingual Cyrillic: Bulgaria, Bosnia, Herzegovinia, Macedonia (FYR)
x-IBM1046ibm1046, ibm-1046, 1046, cp1046IBM Arabic - Windows
x-IBM1097ibm1097, ibm-1097, 1097, cp1097IBM Iran (Farsi)/Persian
x-IBM1098ibm-1098, 1098, cp1098, ibm1098IBM Iran (Farsi)/Persian (PC)
x-IBM1112ibm1112, ibm-1112, 1112, cp1112IBM Latvia, Lithuania
x-IBM1122cp1122, ibm1122, ibm-1122, 1122IBM Estonia
x-IBM1123ibm1123, ibm-1123, 1123, cp1123IBM Ukraine
x-IBM1124ibm-1124, 1124, cp1124, ibm1124IBM AIX Ukraine
x-IBM1166cp1166, ibm1166, ibm-1166, 1166IBM Cyrillic Multilingual with euro for Kazakhstan
x-IBM1364cp1364, ibm1364, ibm-1364, 1364IBM EBCDIC KS X 1005-1
x-IBM1381cp1381, ibm-1381, 1381, ibm1381IBM OS/2, DOS People's Republic of China (PRC)
x-IBM1383ibm1383, ibm-1383, 1383, cp1383IBM AIX People's Republic of China (PRC)
x-IBM300cp300, ibm300, 300, ibm-300IBM Japanese Latin Host Double-Byte
x-IBM3372233722, ibm-33722, cp33722, ibm33722, ibm-5050, ibm-33722_vascii_vpuaIBM-eucJP - Japanese (superset of 5050)
x-IBM737cp737, ibm737, 737, ibm-737PC Greek
x-IBM833ibm833, cp833, ibm-833IBM Korean Host Extended SBCS
x-IBM834ibm834, 834, cp834, ibm-834IBM EBCDIC DBCS-only Korean
x-IBM856ibm856, 856, cp856, ibm-856IBM Hebrew
x-IBM874ibm-874, ibm874, 874, cp874IBM Thai
x-IBM875ibm-875, ibm875, 875, cp875IBM Greek
x-IBM921ibm921, 921, ibm-921, cp921IBM Latvia, Lithuania (AIX, DOS)
x-IBM922ibm922, 922, cp922, ibm-922IBM Estonia (AIX, DOS)
x-IBM930ibm-930, ibm930, 930, cp930Japanese Katakana-Kanji mixed with 4370 UDC, superset of 5026
x-IBM933ibm933, 933, cp933, ibm-933Korean Mixed with 1880 UDC, superset of 5029
x-IBM935cp935, ibm935, 935, ibm-935Simplified Chinese Host mixed with 1880 UDC, superset of 5031
x-IBM937ibm-937, ibm937, 937, cp937Traditional Chinese Host miexed with 6204 UDC, superset of 5033
x-IBM939ibm-939, cp939, ibm939, 939Japanese Latin Kanji mixed with 4370 UDC, superset of 5035
x-IBM942ibm-942, cp942, ibm942, 942IBM OS/2 Japanese, superset of Cp932
x-IBM942Cibm942C, cp942C, ibm-942C, 942CVariant of Cp942
x-IBM943ibm943, 943, ibm-943, cp943IBM OS/2 Japanese, superset of Cp932 and Shift-JIS
x-IBM943C943C, cp943C, ibm943C, ibm-943CVariant of Cp943
x-IBM948ibm-948, ibm948, 948, cp948OS/2 Chinese (Taiwan) superset of 938
x-IBM949ibm-949, ibm949, 949, cp949PC Korean
x-IBM949Cibm949C, ibm-949C, cp949C, 949CVariant of Cp949
x-IBM950cp950, ibm950, 950, ibm-950PC Chinese (Hong Kong, Taiwan)
x-IBM964ibm-964, cp964, ibm964, 964AIX Chinese (Taiwan)
x-IBM970ibm970, ibm-eucKR, 970, cp970, ibm-970AIX Korean
x-ISCII91ISCII91, iso-ir-153, iscii, ST_SEV_358-88, csISO153GOST1976874ISCII91 encoding of Indic scripts
x-ISO-2022-CN-CNSISO2022CN_CNS, ISO-2022-CN-CNSCNS11643 in ISO 2022 CN form, Traditional Chinese (conversion from Unicode only)
x-ISO-2022-CN-GBISO2022CN_GB, ISO-2022-CN-GBGB2312 in ISO 2022 CN form, Simplified Chinese (conversion from Unicode only)
x-iso-8859-11iso-8859-11, iso8859_11Latin/Thai Alphabet
x-JIS0208JIS0208, JIS_C6226-1983, iso-ir-87, x0208, JIS_X0208-1983, csISO87JISX0208JIS X 0208
x-JISAutoDetectJISAutoDetectDetects and converts from Shift-JIS, EUC-JP, ISO 2022 JP (conversion to Unicode only)
x-Johabms1361, ksc5601_1992, johab, ksc5601-1992Korean, Johab character set
x-MacArabicMacArabicMacintosh Arabic
x-MacCentralEuropeMacCentralEuropeMacintosh Latin-2
x-MacCroatianMacCroatianMacintosh Croatian
x-MacCyrillicMacCyrillicMacintosh Cyrillic
x-MacDingbatMacDingbatMacintosh Dingbat
x-MacGreekMacGreekMacintosh Greek
x-MacHebrewMacHebrewMacintosh Hebrew
x-MacIcelandMacIcelandMacintosh Iceland
x-MacRomanMacRomanMacintosh Roman
x-MacRomaniaMacRomaniaMacintosh Romania
x-MacSymbolMacSymbolMacintosh Symbol
x-MacThaiMacThaiMacintosh Thai
x-MacTurkishMacTurkishMacintosh Turkish
x-MacUkraineMacUkraineMacintosh Ukraine
x-MS932_0213
Shift_JISX0213 Windows MS932 Variant
x-MS950-HKSCSMS950_HKSCSWindows Traditional Chinese with Hong Kong extensions
x-MS950-HKSCS-XPMS950_HKSCS_XPHKSCS Windows XP Variant
x-mswin-936ms936, ms_936Windows Simplified Chinese
x-PCKpckSolaris version of Shift_JIS
x-SJIS_0213
Shift_JISX0213
x-UTF-16LE-BOMUnicodeLittleSixteen-bit Unicode (or UCS) Transformation Format, little-endian byte order, with byte-order mark
X-UTF-32BE-BOMUTF_32BE_BOM, UTF-32BE-BOM32-bit Unicode (or UCS) Transformation Format, big-endian byte order, with byte-order mark
X-UTF-32LE-BOMUTF_32LE_BOM, UTF-32LE-BOM32-bit Unicode (or UCS) Transformation Format, little-endian byte order, with byte-order mark
x-windows-50220cp50220, ms50220Windows Codepage 50220 (7-bit implementation)
x-windows-50221cp50221, ms50221Windows Codepage 50221 (7-bit implementation)
x-windows-874ms-874, ms874, windows-874Windows Thai
x-windows-949windows949, ms949, windows-949, ms_949Windows Korean
x-windows-950ms950, windows-950Windows Traditional Chinese
x-windows-iso2022jpwindows-iso2022jpVariant ISO-2022-JP (MS932 based)