MARC-8

MARC -8文字セットは、MARC-21図書館レコードで使用されるMARC標準です。 [1] MARCフォーマットは、書誌情報および関連情報を機械可読形式で表現および通信するための標準であり、図書館データベースシステムで頻繁に使用されます。現在MARC-8として知られている文字エンコードは、1968年にMARCフォーマットの一部として導入されました。もともとはラテンアルファベットに基づいていましたが、1979年から1983年にかけてJACKPHYイニシアチブによりレパートリーが拡張され、日本語、アラビア語、中国語、ヘブライ語の文字などが含まれ、後にキリル文字とギリシャ文字が追加されました。MARC-21レコードのMARC-8で表現できない文字がある場合は、代わりにUTF-8を使用する必要があります。UTF-8は、図書館データ以外ではほとんど使用されないMARC-8よりも多くの文字をサポートしています。

技術的な詳細

MARC-8はISO-2022エンコーディングのバリエーションを使用します。7ビットASCII文字範囲を超える文字を表すためにエスケープ文字を使用します。

一般的に、 Unicode同じ論理BiDi順序を使用します。

結合文字と基本文字の順序は、Unicodeで使用される順序とは異なります。以下にいくつか例を示します。結合文字は、Unicode正規化のように必ずしも逆順で格納されるわけではありません。MARC-21標準では、MARC-8 Unicode変換に関する問題についてより詳細に説明しています。

表示

キャラクター

ユニコード

NFD

MARC-8
á  ́ a
あ̣̂  ̂ ̣ a

コード構造

ISO /IEC 2022コーディングは、文字コードと表示文字との間の2層のマッピングを規定しています。MARC-8では、7ビットASCIIグラフィック範囲(0x20~0x7F)の文字コードは「G0」コードと呼ばれ、「high ASCII」範囲(0xA0~0xFF)のコードは「G1」コードと呼ばれます。グラフィック文字セットは、エスケープ文字、中間文字シーケンス、および最終文字からなる複数バイトのエスケープシーケンス(ESC I F形式)によって指定および呼び出されます。

次の表は、ESC バイト (16 進数 1B) の後の中間バイトと、対応する ASCII 文字を示しています。

中間バイト[2]
G0セットG1セット
SBCSMBCSSBCSMBCS
通常のISO-20222824$2924 29$)
代替ISO-2022(追加63+16セット)2C24 2C$,2D-24 2D$-

次の表は、16 進数の最終バイトと、中間バイト後の対応する ASCII 文字を示しています。

最終バイト[2]
バイトキャラクター名前タイプコメント
311中国語、日本語、韓国語(EACCMBCS
322基本的なヘブライ語SBCS
333基本的なアラビア語SBCS
344拡張アラビア語SBCS
42B基本ラテン文字(ASCIISBCS
21 45!E拡張ラテン語(ANSELSBCS21 (16 進数) は、技術的には、このエスケープ シーケンスの中間セグメントの 2 番目のバイトです。
4E基本的なキリル文字SBCS
51質問拡張キリル文字SBCS
53S基本ギリシャ語(ISO 5428SBCS

EACC は MARC-8 の唯一のマルチバイト エンコーディングであり、各CJK 文字を3 つの ASCII バイトでエンコードします。

例えば、U+4EBA CJK文字(人)をエンコードするには、次のバイトが必要になります。

\x1B\x24\x31\x21\x30\x64

\x1B\x24\x31 は EACC/CJK に切り替わり、\x21\x30\x64 は U+4EBA に対応します。

カスタムセット拡張

ISO-2022文字セットに加えて、以下のカスタムセットも利用可能です。バイト指定はエスケープバイト(16進数1B)に続きます。中間バイトはありません。

最終バイト[2]
バイトキャラクター名前タイプコメント
62b下付き文字セットSBCS
67グラムギリシャ記号セットSBCS通常、アルファ、ベータ、ガンマ文字は Unicode にラウンドトリップ マップされません。
70p上付き文字セットSBCS
73s基本ラテン文字(ASCIISBCS

C0制御コード

MARC 21では、レコードターミネータとしてGS (0x1D)、フィールドターミネータとしてRS (0x1E)、サブフィールドデリミタとしてUS (0x1F)を使用します。 [3]

C1制御コード

図書館システムなどの書誌アプリケーション向けに、以下の代替C1 制御コードセットが定義されています。これは主に文字列の照合と書誌フィールドのマークアップに関係しています。ドイツ規格DIN 31626 [4] (1978 年発行、その後廃止) [5]ISO規格ISO 6630 [ 6] [7]では、若干異なるバリアントが定義されています。ISO 6630 はドイツでもDIN ISO 6630 [8]として採用されています。これらの違いは、下の表で該当する箇所に示されています。MARC-8 では、このセットのNSBNSEのコーディングを使用し、ISO バージョンでは使用されていない場所にいくつかの追加のフォーマット エフェクタを追加しています。ただし、MARC 21 では、この制御セットは MARC-8 レコードでのみ使用し、Unicode 形式のレコードでは使用しません。[3]

ISO/IEC 2022拡張メカニズムを使用する場合、DIN 31626セットはシーケンス0x1B 0x22 0x45ESC " E)でアクティブなC1制御文字セットとして指定され、[4]、ISO 6630 / DIN ISO 6630セットはシーケンス0x1B 0x22 0x42ESC " B)で指定されます。[6] ISO 6630セットの1985拡張もシーケンス0x1B 0x26 0x40 0x1B 0x22 0x42ESC & @ ESC " B)を使用して明示的に指定できます。[7]

Esc+12月ヘックスアクロ名前説明[4] [6] [7]
G13587カス仕分けのクローズアップ(DIN 31626、ISO 6630) スペースまたは区切り文字で区切られた 2 つの連続する文字シーケンスを、照合の目的で 1 つの単語として扱うことを宣言します。
H13688NSB非ソート文字の開始(DIN 31626、ISO 6630、MARC 21) 照合のために無視される文字列の開始を示す。MARC 21ではMARC-8レコードでこの文字を使用するが、 Unicodeレコードでは同じ目的で0x98(SOS )を使用する。 [3] [9]
13789NSE非ソート文字終了(DIN 31626、ISO 6630、MARC 21) 照合のために無視される文字列の終了を示す。MARC 21ではMARC-8レコードでこの文字を使用するが、Unicodeレコードでは同じ目的で0x9C ( ST )を使用する。 [3] [9]
J1388Aフィルフィラーキャラクター(DIN 31626) フィールド内の必須の英数字文字の代わりに使用します。
K1398BTCIコンテキストインジケーターのタグ(DIN 31626) 書誌フィールド内で、タグ番号によって別の書誌フィールドのデータを参照するために使用されます。
PLD部分的な線の下(ISO 6630) ISO 6630のオリジナル版には存在しません。[6] ISO 6630の1985年版では、[7] Partial Line Down(PLDを参照)の意味で使用されました。
L1408CICIコンテキストインジケーターの識別番号(DIN 31626) 書誌フィールド内で、別の書誌レコードのデータを ID 番号で参照するために使用されます。
プル一部ラインナップ(ISO 6630) ISO 6630のオリジナル版には存在しない。[6] ISO 6630の1985年版では、[7] Partial Line Up(PLUを参照)に使用されている。
M1418DOSC [a]オプションの音節分割[b]制御(DIN 31626) 長い単語の音節境界を示す。ソフトハイフンも参照。
ZWJジョイナー(MARC 21)MARC-8ではゼロ幅結合子に使用され、Unicode形式のMARCレコードではU+200Dが使用されます。[3] [9]
1428ESS2シングルシフト2(DIN 31626) 非ロックシフトコードについては、SS2を参照してください。
ZWNJ非参加者(MARC 21)MARC-8ではゼロ幅非結合子に使用され、Unicode形式のMARCレコードではU+200Cが使用されます。[3] [9]
1438階SS3シングルシフト3(DIN 31626) 非ロックシフトコードについては、SS3を参照してください。
P14490-(予約済み)
質問14591EAB埋め込み注釈の開始(DIN 31626、ISO 6630) コンテンツ指定を使用して分離されるのではなく、書誌フィールド内に埋め込まれた可変長注釈の開始を示します。
R14692EAE埋め込み注釈終了(DIN 31626、ISO 6630) 可変長の埋め込み注釈の終了を示します。
S14793ISB項目仕様開始(DIN 31626) キーワードや順列文字列以外の、何らかの説明の特定の情報の文字列の開始を示します。
T14894伊勢項目仕様終了(DIN 31626) 特定の情報の文字列の終わりを示します。
あなた14995SIBソート補間開始(ISO 6630) 照合目的のみで使用される文字シーケンスの開始を示します。
V15096SIEソート補間終了(ISO 6630) 照合目的のみで使用される文字シーケンスの終了を示します。
W15197SSB二次ソート値の開始(ISO 6630) 従属照合値を持つ文字列の開始をマークします。
X15298南南東二次ソート値の終了(ISO 6630) 従属照合値を持つ文字列の終わりをマークします。
はい15399株式会社非標準文字のインジケータ(DIN 31626) 後続の非標準文字を識別します。
Z1549A-(予約済み)
[1559B-(予約済み)
\1569CKWBキーワードの始まり(DIN 31626、ISO 6630) 書誌フィールド内のキーワードの開始を示します。
]1579DKWEキーワード終了(DIN 31626、ISO 6630) 書誌フィールド内のキーワードの終わりを示します。
^1589EPSB順列文字列の始まり(DIN 31626、ISO 6630) 参照またはインデックス生成時に要素の先頭に並べ替えられる文字列の開始を示します。PSE または要素の末尾で終了します。
_1599階PSE順列文字列の終了(DIN 31626、ISO 6630) 要素の先頭に並べ替えられる文字列の終了をマークします。

注記

  1. ^ ISO/IEC 6429 C1 コード セットのオペレーティング システム コマンド (OSC)とは異なります。
  2. ^ ISO-IR-040文書では「Syllabication [ sic ]」と綴られており、説明文では「syllable」が「syllabe [ sic ]」と綴られている。これらはおそらく誤植である。

参考文献

  1. ^ 「文字セット:概要:レコード構造、文字セット、および交換メディアに関するMARC 21仕様(米国議会図書館)」。米国議会図書館
  2. ^ abc 「文字セット:MARC-8エンコーディング環境:MARC 21レコード構造、文字セット、交換メディアの仕様(米国議会図書館)」。米国議会図書館
  3. ^ abcdef 「制御機能コード」。MARC 21 レコード構造、文字セット、および交換メディア仕様米国議会図書館。2007年12月4日。
  4. ^ abc DIN (1979-07-15). ドイツ規格DIN 31626に基づく書誌用追加制御コード(PDF) . ITSCJ/ IPSJ . ISO-IR -40.
  5. ^ 「情報処理;書誌制御文字」 Beuth:出版DIN。DIN 31626:1978-12。
  6. ^ abcde ISO/TC 46 (1983-06-01). 国際規格ISO 6630に基づく書誌用追加制御コード(PDF) . ITSCJ/ IPSJ . ISO-IR -67.{{citation}}: CS1 maint: 数値名: 著者リスト (リンク)
  7. ^ abcde ISO/TC 46 (1986-02-01). 国際規格ISO 6630に基づく書誌用追加制御コード(PDF) . ITSCJ/ IPSJ . ISO-IR -124.{{citation}}: CS1 maint: 数値名: 著者リスト (リンク)
  8. ^ "DIN ISO 6630 1997 年 12 月". AFNORエディション オンライン ストア
  9. ^ abcd 「Code Table Extended Latin (ANSEL)」。MARC 21 レコード構造、文字セット、および交換メディア仕様米国議会図書館。2007年12月5日。
「https://en.wikipedia.org/w/index.php?title=MARC-8&oldid=1248028862#C1_control_codes」より取得