全网唯一标准王
ICS 01.140 A 14 备案号:36939-2012 WH 中华人民共和国文化行业标准 WH/T 45—2012 文本数据加工规范 Text reformatting and transferring specification 2012-08-06发布 2012-12-01实施 中华人民共和国文化部 发布 WH/T45—2012 目 次 前言· 引言 范围· 规范性引用文件 术语和定义 3 4 内容编码标准 存储格式.. 5 6 内容标记 加工准备· 6 文本制作· 8 元数据加工 10 文件命名 11 数据保存, 10 12 质量管理· 11 I WH/T45—2012 前言 本标准按照GB/T1.1—2009给出的规则起草。 请注意本文件的某些内容可能涉及专利。本文件的发布机构不承担识别这些专利的责任。 本标准由中华人民共和国文化部提出。 本标准由全国图书馆标准化技术委员会(SAC/TC389)归口。 本标准起草单位:国家图书馆、中国科学院文献情报中心、贵州省图书馆。 本标准起草人:李晓明、龙伟、赵四友、李成文、朱云、张建勇、周静怡、刘梅、糜翔。 1 WH/T452012 引言 本标准为行业规范,在制定过程中参考了国家图书馆“国家数字图书馆工程标准规范”的部分研制 成果。 本标准为首次制定。 WH/T45—2012 文本数据加工规范 1范围 本标准规定了文本数据加工应遵循的技术规范。本标准针对以文字为主要表达形式,可存在少量图 表的文本文献(不包括古籍善本、手稿等特殊文献)的数据加工制定。加工对象可以是一般印刷型文献, 也可以是印刷型文献经过数字转换后的图像文件。 本标准适用于图书馆、博物馆、档案馆、文献信息中心等文本文献收藏部门,也适用于其他从事文本 数据加工的相关机构。 2规范性引用文件 下列文件对于本文件的应用是必不可少的。凡是注日期的引用文件,仅所注日期的版本适用于本文 件。凡是不注日期的引用文件,其最新版本(包括所有的修改单)适用于本文件。 GB2312一—1980信息交换用汉字编码字符集一基本集(CodeofChinesegraphiccharactersetforinfor- mation interchange-Primary set) GB/T2828.1一2003计数抽样检验程序第1部分:按接收质量限(AQL)检索的逐批检验抽样计划 (Sampling procedures for inspection by attributes-Part 1:Sampling schemes indexed by acceptance quality limit(AQL)for lot-by-lot inspection) GB13000—2010信息技术通用多八位编码字符集(UCS)(IS0/IEC10646:2003:Information technology—UniversalMultiple-OctetCodedCharacterSet(UCS)) GB18030—2005信息技术中文编码字符集(Informationtechnology—Chinesecodedcharacterset) GB/T18793—2002信息技术可扩展置标语言(XML)1.0(Informationtechnology—Extensiblemarkup language(XML)1.0) GB/T23286.1一2009文献管理长期保存的电子文档文件格式第1部分:PDF1.4(PDF/A-1)的使 Part 1:Use of PDF 1.4 (PDF/A-1)) GB/T251002010信息与文献都柏林核心元数据元素集(Informationanddocumentation一The Dublin Core metadata element set) ISO/IEC10646:2003信息技术通用多八位编码字符集(UCS)(Informationtechnology一Universal Multiple-Octet Coded Character Set (UCS)) IS032000—1:2008文献管理便携式文档格式第1部分:PDF1.7(Documentmanagement—Portable documentformat—Part1:PDF1.7) 1 WH/T45-—2012 3术语和定义 下列术语和定义适用于本文件。 3.1 文献document 在文献工作过程中作为一个单位处理的记录信息或实物对象。 注:来源于GB/T4894—2009 3.2 文本text 以字符、符号、词、短语、段落、句子、表格或者其他字符排列形成的数据,用于表达意义,其解释基本 上取决于读者对于某种自然语言或者人工语言的知识。 注1:来源于CB/T4894—2009 注2:在本规范中等同于“文本数据” 3.3 图像image 由扫描仪、数码相机等输人设备捕捉实际的画面产生或由计算机软件产生的数字图像。 3.4 光学字符识别opticalcharacterrecognition 又称OCR识别,自动识别通过扫描仪、数码相机、摄像机等得到的图像中的字符,便于存储、编辑和检索。 3,5 点/英寸dotsperinch(dpi) 扫描仪(打印机)在水平方向上和垂直方向上的每英寸都能扫描(打印)的点数。 注:来源于GB/Z19736—2005 3.6 元数据metadata 关于数据的内容、质量、状况和其他特征的描述性数据。 注:来源于GB/T48942009,4.4.1.1.19。 4 内容编码标准 文本内容编码应遵循通用的国家标准或国际标准。文本内容编码可选择表1所列标准。 表1文本内容编码标准 标准编号 标准名称 简要说明 规定了汉字信息交换用的基本图形字符及其二进制编码表示。 它是一个简化字汉字的编码,其共收录6763个汉字,其中一级 信息交换用汉字编码字符 GB 2312—1980 汉字3755个、二级汉字3008个。此外,还收录了包括拉丁字 集基本集 母、希腊字母、日文平假名及片假名字母、俄语西里尔字母在内 的682个全角字符 2 WH/T45-2012 表1文本内容编码标准(续) 标准编号 标准名称 简要说明 规定了信息技术用的中文图形字符及其二进制编码的十六进制 表示,适用于图形字符信息的处理、交换、存储、显现、输入和输 GB18030—2005 信息技术中文编码字符集 出。它是我国自主研制的以汉字为主并包含我国多种少数民族 文字的超大型中文编码字符集强制性标准,共收入70244个 汉字 规定了UCS的总体结构。其编码空间巨大,可以容纳多种文字 信息技术通用多八位编 GB13000—2010 同时编码,共收录汉字20902个。作为统一的编码,GB13000 码字符集(UCS) 采用相同数目的“八位”编码 IS010646标准由国际标准化组织颁布,用来实现全球所有文种 的统一编码。该标准被广泛应用于电子化地表示、传输、交换、处 信息技术通用多八位编 理、储存、输入及显现世界上各种语言的书面形式以及附加符号。 码字符集(Informationtech- 它收录了20902个汉字(表意字符)。它与Unicode在字符编码 IS0/IEC10646—2003 nology—Universal Multiple- 上保持一致,在两个标准里,所有的字符都在相同的位置并且有 Octet Coded Character Set) 相同的名字,并且版本更新也保持同步,IS0/IEC10646:2003的 字符编码相当于Unicode5.0。只是Unicode额外定义了许多与 字符有关的语义符号学,且两者部分样例字形有区别 美国国家标准学会(AmericanNationalStandardInstitute,ANSI)制 定的标准的单字节字符编码方案,主要用于显示现代英语和其他 西欧语言。ASCI码使用指定的7位或8位二进制数组合来表示 美国信息交换标准码 128或256种可能的字符。标准ASCII码也叫基础ASCI码,使 ASCII (American Standard Code 用7位二进制数来表示所有的大写和小写字母、数字0到9、标点 for Information Interchange) 符号,以及在美式英语中使用的特殊控制字符。后128个称为扩 展ASCI码,扩展ASCII码允许将每个字符的第8位用于确定附 加的128个特殊符号字符、外来语字母和图形符号 5存储格式 5.1XML格式 5.1.1可扩展标识语言 XML(ExtensibleMarkupLanguage)格式是一种表示结构化信息的开放的文本数据格式。XML用统 一的方法进行描述和交换,是独立于应用程序的结构化数据格式。XML可以描述各种各样的结构信息, 并且由于它的数据内容独立性原则和可自解释性,使得用它表示的数据信息可以很方便地被不同的数据 使用者使用。 5.1.2用途 XML格式通常有两种用法: 3

.pdf文档 WH-T 45-2012 文本数据加工规范

文档预览
中文文档 15 页 50 下载 1000 浏览 0 评论 309 收藏 3.0分
温馨提示:本文档共15页,可预览 3 页,如浏览全部内容或当前文档出现乱码,可开通会员下载原始文档
WH-T 45-2012 文本数据加工规范 第 1 页 WH-T 45-2012 文本数据加工规范 第 2 页 WH-T 45-2012 文本数据加工规范 第 3 页
下载文档到电脑,方便使用
本文档由 人生无常 于 2025-12-14 18:57:47上传分享
友情链接
站内资源均来自网友分享或网络收集整理,若无意中侵犯到您的权利,敬请联系我们微信(点击查看客服),我们将及时删除相关资源。