当前位置：文档之家› 初中英语论文双语平行语料库对齐技术述评

初中英语论文双语平行语料库对齐技术述评

双语平行语料库对齐技术述评

对齐的双语语料库在机器翻译、词义消歧和双语词典编撰等领域都非常有用。语料对齐的单位由大到小，有篇章、段落、句子、短语、词等不同的层次。粒度越小，提供的语言信息就越多，应用的价值也就越大。然而平行语料库的自动对齐并非是一件容易的事情。由于语料大都来自人工翻译，句子之间并不都是一对一的翻译模式，还有一对多、多对多的翻译模式。这种复杂性加大了对齐的难度，特别是对更细粒度级别的对齐。由于语言之间存在着差异，找到固定的对应翻译很难，再加上文本预处理工具难以保证处理效果，以及一些电子文本的噪声纷繁复杂，这都增加了对齐的难度。而对于英汉两种差别很大的语言来说，目前的语料库对齐算法并不一定完全适用于汉英语料库的对齐。本文首先回顾了当前国外平行语料库的对齐技术，然后分析了国内在对齐中所使用的技术，旨在为本研究所今后构建小型汉英平行语料库提供一个技术支持。

1 目前平行语料库对齐技术的现状

1.1 句子级对齐技术

在各级对齐研究中，其中最为重要且较为成熟的自动对齐技术是句子一级的对齐。句子级对齐的方法主要有三种：① 基于长度的方法(length-based)(Brown et al,1991; Gale & Church, 1991a)；② 基于词汇的方法(lexical-based)(Kay & Roscheisen, 1993)；③ 混合法(combination)(Tan & Nagao, 1995; Wu,1994)。

基于长度的方法最早是由Brown和Gale提出，虽然他们的算法都是由源文本中句子长度和译文本中的句子长度有很大的正相关这一观察得出，但其侧重点却不同。Brown的算法以词为单位计算句子的长度，而Gale和Church则是以字符为单位计算句子的长度。他们分别用各自的算法对加拿大议会会议所录英法双语语料库进行了对齐实验，准确率达96~97%。然而该方法在处理复杂句子的对齐(如2∶1或2∶2的句子对齐,或非直译和省略的句子)以及不同语系的句子对齐时，准确率却并不高，而且此算法一旦出错，便不可能自动纠正。

基于词汇的方法是由Kay和Rosheisen提出的。他们认为最佳的句子对是那些使系统词汇对齐数量最大化的句子。基于词汇的算法虽然可以提高对齐的准确性，但却费时；而且目前还没有充分证明这一方法适合于大型语料库。Chen(1993)对Kay 和 Rosheisen的算法进行了改进，这一算法运用词汇信息构建了一对一词汇统计翻译模型,用这样的翻译模型找到语料库生成的最大可能性。他用此算法对旧的Hansard语料库进行双语对齐。与Brown和Gale的对齐算法相比，这一算法不仅正确率高，而且在处理大量省略的对齐中能轻易确定省略的位置，且鲁棒性(robust)较好。基于词汇方法的另一种做法是利用同源词(cognate)(Church,1993)。此方法在处理英法和英德语言中的诸如名字、日期、数字、术语等可辨认单位出现比率高的情况下效果更好。

如前所述，基于词汇的方法相对可靠精确，但计算起来相当复杂且速度较慢；而基于长度的算法模型虽然简单，独立于语言知识和外部资源，但鲁棒性不好，极易造成错误蔓延。由于每种方法都有自己的优缺点，人们试图将各种方法混合起来找到问题的解决途径(Tan & Nagao, 1995; Wu,1994; ;Collier,1998; Vronis，1999；Melamed，2000)。试验结果表明，混合的方法优于单纯使用其中的任何一种方法。

1.2 词汇级对齐技术

与句子对齐相比，词汇对齐的应用价值更加直接。目前词对齐主要有基于统计(也称为基于同现)的方法、基于词典和语言学知识的方法。

基于统计的方法是通过大规模双语语料的统计训练，获得双语对译词的同现概率，以此来获得对齐。一种统计法是基于机器翻译模型的词汇对齐法(Brown et al., 1993，吴尉林，2003 )。此法用词汇对齐模

型来实现翻译模型并通过EM(expectation-maximization)算法来进行词汇对齐。但是该方法不仅在运行时需要很大的内存空间，而且EM算法本身也缺乏鲁棒性。另一种统计法是基于同现的词汇对齐(Gale & Church,1991b; Zhang Ying et al., 2001)。其中，Gale & Church 用同现测度函数对译双语词汇，通过统计对译词在双语句对中同现的频率来确定双语词汇之间的对应关系，并为每个双语词对引入一个联列表(Contingency Table)。基于同现的对齐算法简单，鲁棒性也比EM算法好，但是该方法在计算时没有考虑词汇的上下文关系，因此获得的词汇翻译对应存在着间接相关的问题。

基于词典和语言学知识的词汇对齐方法。机读双语词典包含丰富的词汇对译信息，是进行词对齐的重要资源。Ker(1997)根据语义类实现词对齐，结果显示该方法在获得很高的准确率的同时，能克服基于统计方法中存在的低覆盖率的问题。Huang(2000)用语言学比较的方法进行词对齐。此外还有用隐马尔可夫模型和最大熵模型(Necip,2006)进行词对齐。

1.3 多词组合单位对齐

多词组合单位(multi-word unit alignment——MWU)对齐也就是短语或词的搭配对齐。在自然语言的理解过程中，更多的是通过短语或者固定搭配而非单个的词来传达要表达的意义。在双语平行语料库中许多词并没有直接的翻译对等词。为了理解这些多词单位的意义，不仅要考虑不同语言词之间的相互关系，而且也要考虑同一语言中这些词的搭配。因此，多词组合单位的对齐也是双语语料库对齐工作中的一项重要且富有挑战的任务。许多研究者对此已做了深入的研究，方法主要有n-gram、近似字符匹配、有限状态机、双语语法分析树等。其中有些做法最为典型，如Dagan & Church的Termight系统、Smadja et al.的Champollion系统和McEnery et al.(1997)用近似字符串匹配技术ASMT和有限状态自动机从平行语料库中提取术语翻译。但是英语和汉语使用不同的文字系统，所以ASMT不能应用于英汉多词单位的对齐。

1.4 从句和段落的对齐

如前所述，与句子和词汇对齐研究相比较，对段落和从句对齐的研究要少的多。其中一个原因就是段落的界限比句子清楚，所以其对齐也简单。Gale & Church(1991a)认为，基于长度对齐的算法可以用于段落的对齐。尽管从句对齐对于诸如基于实例的翻译、语言教学、对比研究等领域的应用非常有用，但是由于每种语言，尤其是不同语系语言之间存在如何界定从句界限的问题，所以与简单句相比较，从句的对齐更难且容易出错。Kit et al.(2004)用包含双语法律术语表、双语字典的词汇方法和相似性度量法对香港法律文本进行了从句对齐。实验结果表明，这一算法即简单又有效，其准确率达94.6%。

2 目前国内英汉平行语料库的对齐研究

英汉属于不同的语系，上述的对齐方法对印欧语系(尤其是英语和法语)效果较好，但对于语法结构相差甚远的印欧与亚洲语系(汉语和日语)来说，效果却不如前者。例如，基于长度方法的同源词法能够提高相近语系语料对齐的准确性，但是，对英汉两个完全不同的语系来说，由于没有拼写、语音或语义相似的同源词，所以这种方法就不适用于英汉双语对齐。如果单纯地使用基于长度的方法，效果也不是很好，因为汉语分词问题很难解决，利用词的个数作为长度单位不但不可靠，而且分词结果也会影响互译信息率的计算。因此，目前对于汉英句子对齐常用的方法是将基于长度和基于词汇这两种方法进行改进或混合使用。香港大学的Wu(1994)通过创建特殊词表对Gale 和 Church的基于长度的算法进行了适当的改进，用此算法对香港立法委员会会议记录英汉语料库做了对齐实验。结果表明，在句子对齐中，1:1 的匹配的准确率接近90%。Sun(1999)在处理英汉语料库句子对齐时，对基于字符的长度算法进行了改进。这一方法弥补了基于字符长度算法不能处理1:0或0:1的句子对齐(即省略或插入)的不足。它与其它混合法不同的是，其它算法通过动态规划把长度和词汇信息结合起来，而此法是先单独使用，然后再用词汇法进行对齐正误判断，正确的对齐从语料库中抽出,然后对剩余的句子再进行对齐，如此反复，其正确率达到93%。钱丽萍等(2000)提出了基于译文的对齐方法，该方法借助一部翻译较完整的词典，将汉英句子间的对应关系连起来。实验证明，这一方法虽然“从根本上消除了基于长度的对齐方法中由于文本的缺失或局部对错造成的错误蔓延，并且对于一般文本普遍适用”(2000:61),但却无法处理2:2句对的情况。

Chuang et al.(2005)提出了一种基于标点符号的句子对齐法。他们用此方法对汉-英

SMC(Chinese-English Sinorama Magazine Corpus )平行语料库进行对齐。结果显示，基于标点符号的方法胜于基于长度的方法，其准确率超过93%。他们还验证了此方法可以用于其它的双语文本，如日语和英语。

张艳等(2005)使用了一种基于长度的扩展方法。这一方法以长度算法为基础，引入词汇信息，然后采用基于标点符号的方法作为后处理。测试结果证明“这种混合方法可以有效地提高汉英双语句子对齐的正确率，并且对多领域的文本具有很好的移植性”(2005:36)。

李维刚等(2006)提出一种基于句子长度和位置信息的结合算法。为了验证这一算法的有效性，他们使用了基于长度的算法，基于位置信息以及两者结合的方法对《呼啸山庄》第17章的英汉双语文本进行了测试。三种方法的准确率分别为20.3%、85.2%和92.5%。

对汉-英词汇对齐来说，由于文字系统存在很大的差异，汉语句子不象英语句子那样，词与词之间没有间隔，而且汉语对词的界定很模糊,造成词切分的错误率也就增高，因此英汉语对应词的对齐的难度也相应地增大。尽管有些方法可以直接用于汉英语料库词汇对齐，如 Wu(1995)用Brown的EM算法对英汉词汇对齐进行测试，正确率达91.2%~95.1%，但这不能完全适用于汉英词汇的对齐。Fung and Church(1994)提出了K-vec算法。这一算法的单词对齐不需要在句子对齐的前提下进行，只测试候选词在位置分布上的相似度，但对双语词只能做粗略的估计。吕学强(2004)提出了基于语料库的无双语词典的英汉词对齐模型。该模型几乎不需要任何语言学知识和语言学资源，是语料库方法的独立应用。该方法不仅能对齐高频词、低频词，而且对未登录词和汉语分词错误具有兼容能力。晋薇等(2002)运用了语义相似度和语言学知识进行双语语句词对齐，达到了85%的准确率。为了能得到有效的汉英词汇对齐，目前大多数算法综合运用了基于统计和基于词典对齐的方法(刘小虎，1997；王斌，1999；吕雅娟，2001； Piao，2001)。其中 Piao(2001)把诸如同现量度、词汇分布距离、英语单词的形态还原等结合起来提出一种算法。该算法在英汉平行语料库中进行了试验，准确率达80.63%。王斌(1999)在他的研究中顺次用基于词典、基于语义类、基于翻译位置、基于翻译共现频率等多种算法将词典搜索和无词典统计的方法结合起来，不仅充分有效地利用了现有的有限资源，而且还避免了对大量数据过多的无效统计和训练，节省了运行的空间和时间，提高了词汇对齐的召回率和正确率。但是这些算法都过多的依赖语义词典、大规模句对齐双语语料库和大规模同源词形态分析匹配规则库等语言资源，而高质量的语言资源的建设非常昂贵，由此限制了这些算法的使用范围和效果。张孝飞等(2006)试图通过加强词对齐算法本身的复杂性来减轻对语言资源的依赖性。他们提出了一种基于锚点词对的对齐算法，经过对真实语料的测试，词对齐的准确率达到93%。

对于多词组合对齐，近年来国内也有许多这方面的研究。常宝宝(2002)提出了基于词汇关联度进行多次组合的识别方法，并利用假设——检验的方法在汉英双语语料库中抽取翻译等价单位。吕雅娟等人(2003)用N-gram模型获取候选翻译单位，然后根据统计同现计算候选等价对的翻译概率，并用贪心策略实现翻译等价对的自动抽取。刘冬明(2003)将基于长度和基于词典的算法混合进行了名词短语的对齐。测试结果证明，这两种方法在最终结果上可以互补。刘建基(2006)采用了统计关联度加词对齐的方法，先利用关联度获取汉语候选组块，再利用词对齐获取双语候选组块。该方法的优点是能够在一遍扫描语料库的过程中获取双语组块，但在识别单语组块时有一定的局限性。张春祥等(2006)提出一种基于中心语块扩展的短语对齐，实验结果表明，该方法的对齐正确率达到82.76%。

虽然段落对齐可以象Gale所说的那样利用句子对齐的方法来解决，但是直接进行段落的自动对齐却具有相当的难度。王斌提出以“分段＋对齐”为原则，分段对齐的优点在于不受段落是否已有边界或已有边界是否清晰等的限制，而是以对齐为目的重新组织段落。在分段对齐过程中，“通过匹配分布相似的词汇对，找到可以用于分段的锚点句子，利用这些锚点句子和其他特殊句子对之间的匹配程度对双语文本进行分段对齐，…实验结果表明分段对齐具有相当的可行性”(1999:47)。目前国内对从句对齐研究非常少，在收集到的文献中只有Kit et al.(2004)和吕学强等(2003)进行了研究。

综上所述，双语自动对齐问题的研究大多集中在句子和词汇一级上。研究的方法大概有三种：一是基

于统计的方法，即先对大量的双语语料进行统计训练，获得双语对译句/词的同现概率，建立句子/词汇对

齐的统计模型，用来判断句子/词的对译关系；二是基于词汇/词典的方法；三是把统计手段和词汇/词典结合起来。含有汉语的双语语料库大多采用这种方法。但不是所有的方法都适用于英汉平行语料库的对齐，

而要依据语料的特点和语料对齐的目的进行方法的选择。

3 结语

本文对国内外平行语料库的对齐方法进行了阐述，分析了各种对齐方法的长处和不足之处并讨论了用

于汉-英平行语料库的对齐方法。由于英汉属于不同的语系，不同语言在语序、句子结构和逻辑意义的表达方面都存在着明显差异，以及不同语言本身存在的一些未解决的语言问题，使得语料库对齐的方法也各异。因此，用于欧洲语系的对齐方法不能完全用于汉英平行语料库的对齐。上述的研究将为我们建立小型汉英

平行语料库提供一种技术支持。

参考文献

[1] Brown, P. F., Della Pietra, S.A., Della Pietra, V. J. and Mercer, R.L. The Mathematics of Statistical Machine Translation: Parameter Estimation[J]. Computational

Linguistics,1993,19:2.

　[2] Brown, P. F., Lai, H. C. and Mercer, R. L. Aligning sentences in parallel corpora[C]. Proceedings of the 29th Annual Meeting of the Association for Computational Linguistics,1991.

　[3] Chen, S. Aligning sentences in bilingual corpora using lexical information[C]. Proceedings of the 31th Annual Meeting of the Association for Computational Linguistics,1993.

[4] Chuang. C.T and Kevin C. Aligning Parallel Bilingual Corpora Statistically with Punctuation Criteria[J]. Computer Science and Information Engineering,2005,10:1.

　[5] Church, L. W. Char_ align: program for aligning parallel texts at the character level[C]. Proceedings of the 31 th Annual Meeting of the Association for Computational Linguistics,1993.

[6] Collier, N., Ono, K., and Hirakawa, H. An Experiment in Hybrid Dictionary and Statistical sentence alignment[C]. Proceedings of the 36th Annual Meeting of the Association for Computational Linguistics and the 17th International Conference on Computational Linguistics,1998.

[7] Fung, P. and Church, K. W. K-vec: A new approach for aligning parallel texts[C]. Proceedings of the 15th International Conference on Computational Linguistics 1994.

[8] Gale, W. and Church, K. A program for aligning sentences in bilingual corpora[C]. Proceedings of the 29th Annual Meeting of the Association for Computational Linguistics. 1991(a)

[9] Gale, W., Church, K. Identifying word correspondences in parallel texts[C]. Proceedings of the 4th DARPA Speech and Natural Language Workshop 1991(b).

[10] Huang J.X. and Choi K.S. Chinese-Korean word alignment based on linguistic comparison[C].Proceedings of the 38th Annual Meeting of the Association for Computational Linguistics. 2000.

　[11] Kay, M. and Roscheisen, M. Text-translation alignment[J]. Computational Linguistics. 1993(19:1).

[12] Ker, S. J. and Chang J.S. A class-based approach to word alignment[J]. Computational Linguistics,1997(23:2).

[13] Kit, C.Y., Webster, J. J., Sin, K.k., Pan, H.H. and Li, H .Clause Alignment for Bilingual

Hong Kong Legal Texts with Available Lexical Resources[Z].

https://www.doczj.com/doc/049217433.html,.hk/~ctckit/papers/iccpol2003-clause- align.pdf 2004.

　[14] McEnery T., Jean-Marc L., Michael O., and Jean V. The exploitation of multilingual annotated corpora for term extraction[M]. in Roger Garside, Geoffrey Leech and Anthony McEnery (eds.), Corpus Annotation——Linguistic Information from Computer Text Corpora: Longman,1997.

[15] Melamed, I. D. Models of Transnational Equivalence among Words[J]. Computational Linguistics,2000,26:2.

[16] Necip F. A., and Bonnie J. D. A maximum entropy approach to combining word alignments[C]. Proceedings of Human Language Technology Conference of the North American Chapter of the ACL 2006.

[17] Piao, S. S. Parallel corpora and alignment: What is it? What do we align?[Z]. http:// https://www.doczj.com/doc/049217433.html,ncs.ac/uk/staff/piaos/research/ alignment/ alignment.htm,2001.1.

[18] Sun L., Du L., Sun, Y. F. and Jin Y. B. Sentence alignment of English-Chinese complex bilingual corpora[Z]. http:// www.korterm.kaist.ac.kr/nlprs99/mal99-papera/mal-109.pdf .1999.

[19] Tan, C.L. and Nagao, M. Automatic alignment of Japanese-Chinese bilingual texts[J]. IEICE Transactions on Information and Systems,1995.1.

[20] Vronis, J. From the rosetta stone to the information society: a survey of parallel text processing[Z]. http://www.up.univ-mrs.fr/~veronis/pdf/2000-PTP-chapter1.pdf 1999.

[21] Wu, D. Aligning a parallel English-Chinese corpus statistically with lexical criteria[C]. Proceedings of the 32 th Annual Meeting of the Association for Computational Linguistics,1994.

[22] Wu, D. Large-scale automatic extraction of an English-Chinese translation lexicon[J]. Machine translation,1995.

[23] Zhang Y., Brown, R. D. and Robert E. F. Adapting and example-based translation system to Chinese[C]. Proceedings of HLT: First International Conference on Human Language Technology Research,2001.

[24] 常宝宝.基于汉英双语语料库的翻译等价单位自动获取研究[J].术语标准化与信息技术,2002.

[25] 晋薇，黄河燕，夏云庆.基于语义相似度并运用语言学知识进行双语语句词对齐[J].计算机科学,2002.11.

[26] 李维刚，刘挺，张宇，等.基于长度和位置信息的双语句子对齐方法[J].哈尔滨工业大学学报,2006.5.

[27] 刘冬明，赵军，杨尔弘.汉英双语语料库中名词短语的自动对齐[J].中文信息学报,2003.5.

[28] 刘建基.基于关联度和词对齐的双语组块获取研究[D].南京理工大学硕士论文.2006.

[29] 刘小虎，吴葳，李生,等.基于词典和统计的语料库词汇级对齐算法[J].情报学报,1997.1.

[30] 吕学强，李清隐，任飞亮，姚天顺.基于统计的汉英法律文献亚句子级对齐[J].东北大学学报,2003.1.

[31] 吕学强，吴宏林，姚天顺.无双语词典的英汉词对齐[J]. 计算机学报,2004. 8.

[32] 吕雅娟，赵铁军，李生等.统计和词典方法相结合的双语语料库词对齐[A].自然语言理解与机器翻译[M].北京：清华大学出版社,2001.

[33] 吕雅娟，李生，赵铁军等.基于双语语料库的翻译等价对自动抽取[J].高技术通讯,2003.5.

[34] 钱丽萍，赵铁军，杨沫昀，等.基于译文的英汉双语句子自动对齐[J].计算机工程与应用,2000.12.

[35] 王斌.汉英双语语料库自动对齐研究[D].博士论文.1999.

[36] 吴尉林，屈刚，陆汝占.基于锚词对的英汉双语语段对齐模型[A].孙茂松，陈群秀主编.语言计算与基于内容的文本处理[M].北京：清华大学出版社,2003.

[37] 张春祥，李生，赵铁军.基于中心语块扩展的短语对齐[J].计算机研究与发展,2006,9.

[38] 张孝飞，陈肇雄，等.基于锚点词对的双语词对齐算法[J].小型微型计算机系统,2006,2.

[39] 张艳，柏冈秀纪.基于长度的扩展方法的汉英句子对齐[J].中文信息学报,2005,5.

An Overview of the Alignment of Bilingual Parallel Corpora

HUANG Jun-hong, FAN Yun, HUANG Ping

(College of Foreign Languages, Chongqing University, Chongqing 400044, China)

Abstract: Based on wide literature review on parallel corpora, this article first carries out the research on different algorithms of alignment on the linguistic level of paragraph, sentence, clause as well as words in parallel corpora and then analyses their advantages and disadvantages; finally it discusses the algorithms of alignment which are restricted in aligning Chinese-English parallel corpus. It aims to provide a technical basis for constructing small-scale Chinese-English parallel corpora for our research institute.

Key words: Parallel Corpora; Alignment

语料库术语中英对照

Aboutness 所言之事 Absolute frequency 绝对频数 Alignment (of parallel texts) （平行或对应）语料的对齐 Alphanumeric 字母数字类的 Annotate 标注（动词） Annotation 标注（名词） Annotation scheme 标注方案 ANSI/American National Standards Institute 美国国家标准学会 ASCII/American Standard Code for Information Exchange 美国信息交换标准码Associate (of keywords) （主题词的）联想词 AWL/Academic word list 学术词表 Balanced corpus 平衡语料库 Base list 底表、基础词表 Bigram 二元组、二元序列、二元结构 Bi-hapax 两次词 Bilingual corpus 双语语料库 CA/Contrastive Analysis 对比分析 Case-sensitive 大小写敏感、区分大小写 Chi-square (χ2) test 卡方检验 Chunk 词块 CIA/Contrastive Interlanguage Analysis 中介语对比分析 CLAWS/Constituent Likelihood Automatic Word-tagging System CLAWS词性赋码系统Clean text policy 干净文本原则 Cluster 词簇、词丛 Colligation 类联接、类连接、类联结 Collocate n./v. 搭配词；搭配 Collocability 搭配强度、搭配力 Collocation 搭配、词语搭配 Collocational strength 搭配强度 Collocational framework/frame 搭配框架 Comparable corpora 类比语料库、可比语料库 ConcGram 同现词列、框合结构 Concordance (line) 索引（行） Concordance plot （索引）词图 Concordancer 索引工具 Concordancing 索引生成、索引分析 Context 语境、上下文 Context word 语境词 Contingency table 连列表、联列表、列连表、列联表 Co-occurrence/Co-occurring 共现 Corpora 语料库（复数） Corpus Linguistics 语料库语言学 Corpus 语料库 Corpus-based 基于语料库的

双语对应语料库翻译教学平台的应用初探_王克非

语言技术与外语教学研究 *版权所有文责自负* 双语对应语料库翻译教学平台的应用初探王克非1 ,秦洪武2 ,王海霞 2 (1.北京外国语大学中国外语教育研究中心,北京 100089;2.曲阜师范大学外语学院,山东曲阜 273165) 摘要:本文通过语料呈现实验探讨双语对应语料库翻译教学平台的应用效果。实验显示,学生在观察语料后能够归纳和总结出有意义的翻译技巧,并能据此评估或反思自己的翻译行为。实验表明,在翻译课堂教学中使用语料资源有助于自主学习和发现式翻译教学环境的创建,也有助于学习者形成稳定的翻译技巧。关键词:对应语料库;翻译教学;发现式学习;语料呈现中图分类号:H 319.3 文献标识码:A 文章编号:1001-5795(2007)12-0003-0006 近20年来,语料库的创建和应用取得了长足发展。对应语料库大都在上世纪九十年代开始创建,起步较晚,但已展现出广阔的应用前景。在欧美,这类语料库有十多个,涉及近20个语种,如H ansard(法-英对应语料库)和ENPC (英语-挪威语对应语料库)(V ron is 2000:14-15);在中国,有中科院计算所的大规模汉英对应语料库、北京大学的/B ABLE 汉英平行语料库0,以及北京外国语大学的/通用汉英对应语料库0(该库现有可检索语料2千万字/词以上,见王克非2004a),后者是本项研究使用的主要工具。对应语料库的创建有两个主要目的:一是用于语言与翻译研究,二是用于外语教学。用于前者的研究成果丰富,涉及语言对比、双语词典编纂和翻译研究(Lav i o sa 1997;Baker 1999;Serpellet 2000;H unston 2002)。用于后者尤其是用于翻译教学的研究也已取得不少成果,如Zanetti n 1998、Pearson (2003:15-24)和Bernardini (2004b :97-111),但大都研究平行语料为翻译训练提供的可能的资源和手段,还没有研究探讨大型对应语料库在课堂教学中的实际应用问题。 1 研究内容有关运用语料库提高翻译效率和质量的研究还没有全面展开,而将对应语料库应用于翻译教学的研究则是刚刚开始(Bo w ker 2003;Ber nardi n i 2004b)。从理论上看,语料库用于教学有利于自主学习环境的创建(Bernardini 2004a :22;秦洪武、王克非2007)。自主性学习主要表现在两个方面:研究性学习和发现式学习(learning as discovery)。前者假定学习者和教师研究兴趣相投、研究能力相当;后者则鼓励学习者自行调节兴趣点,并给他们提供机会来提高自己观察和处理问题的能力,使他们对两种语言的特征和差异有敏锐的觉识。本文认为,研究和发现虽不矛盾,但在以技能培养为核心的翻译教学中,不宜过分强调学生的研究能力,发现式学习这一提法更合适一些。近年来,国内也有研究关注语料库在翻译教学中的应用问题。有些研究探讨了语料库在翻译教学中的用途(郭红2004;于连江2004;王克非2004b),但还没有研究系统地探讨对应语料在课堂教学中的应用方式和应用效果,也没有研究关注学生对于语料使用的态度。鉴于此,我们以/通用汉英对应语料库0为翻译教学平台,探讨在现有技术条件下翻译语料用于翻译教作者简介:王克非:男,教授,博士生导师。研究方向:语言学、翻译学。秦洪武:男,教授,博士。研究方向:语言学、翻译学。王海霞:女,讲师,硕士。研究方向:翻译学。收稿日期:2007-03-18 基金项目:本文是国家社科基金课题/基于大型英汉对应语料库的翻译研究与翻译教学平台0的阶段性成果(编号05BYY 013),并获得曲阜师范大学科研启动基金资助(编号Bsqd2007022)。 # 3#第118期2007年12月外语电化教学 C AFLE N o .118D ec . 2007

基于双语平行语料库的翻译教学

基于双语平行语料库的翻译教学翻译是英语专业高年级学生一门非常重要的课程。传统的翻译教学以教师讲解为中心，以翻译教材为学习载体，学生在上完课之后很难具备一定水平的翻译能力。针对于此，我们把双语平行语料库及相应的检索功能引入到翻译教学当中，以提高翻译教学质量，提升学生的翻译能力。标签：双语平行语料库；翻译；教学双语平行语料库是指使用两种语言撰写相互间具有翻译关系的文本的集合平台，与普通的词典相比，这种翻译方法更加准确、便利、快捷，更新速度快，可以提供大量真实的双语对译语料以供学习者查询。何安平指出，将语料库引入翻译教学，会改变传统的翻译教学模式，使学生可以开展各种学习活动，比如互动式学习、开放式学习和分析归类型学习，这一系列学习可以激发学生的好奇心、求知欲，帮助学生塑造的批判精神和反思精神，为培养学生的创新思维提供了条件。本文例句所使用的双语平行语料库是指北京外国语大学通用双语平行语料库。 1.基于双语平行语料库的词汇翻译曾有人提出，平行语料库最典型的应用范围之一是双语词汇教学。无论是英译汉还是汉译英，在很多时候英汉两种语言不存在一一对应的词汇，一词多义的现象很普遍，这就意味着这个词有多种译文；而且，在某些特定的语境中，有的词被赋予固定的意思，这又是新的译文。北京外国语大学王克非教授以汉语“克服”一词为例，在北京外国语大学通用汉语双语平行语料库中检索，发现24处“克服”一词中，有15处翻译为overcome。在学生学习完这24个例子后，他们就会明白，在以后的翻译中，不是所有的“克服”都用overcome翻译，在其他情况下使用cope with，fight down，get rid of 等会更加贴切。学习者可以借助双语平行语料库的真实语境平台，找到单词在不同语境下的地道翻译，既丰富了词汇量，快速准确地译出对应语，同时可增强语感，提升双语翻译能力。 2.基于双语平行语料库的句式翻译有时候，学生会感觉无论是英语还是汉语，其中一些句式很难理解，至于翻译更是无从下手。在这种情况下，双语平行语料库为学生们提供了大量的特殊句式翻译例句。我们以英文中“it is said that”为例。这是英语中常用的句式，很多学生张口就翻译为“据说”，好像也没有人怀疑过；包括我本人在接触双语平行语料库之前，见到it is said that也随口就翻译为“据说”。但是，笔者通过双语平行语

英语作文写作模板

1、介绍一项发明第一步：引出主题【高分策略】：介绍老年人因独自居住而在生活中遇到的某种困难，可以简述社会中的普遍现象，也可以通过一个具体事例引入。【参考句型】 ◆In modern society, many old people have to live alone. ◆Mobile phones are very popular but old people often find it difficult to use them. ◆We can often hear such news: an old man or woman fell down on the street and no one came up to help them. ◆In fact, old people need simpler computers to use in life. ◆It is a pity that many old people live alone and they cannot get help quickly enough when in need. ◆My grandfather is 65 years old. He lives alone and he has some trouble when watching TV at home. ◆It is impossible for them to get information easily. 第二步：简要介绍由此情况引发的设计灵感和此项发明的名称【高分策略】：可以恰当使用一些表达因果关系的句型【参考句型】 ◆That’s why I want to invent this smart bicycle for them to ride. ◆In this case, they need more comfortable seats on buses. ◆If I were one of them, I would like …… ◆I wish I could do something to cheer them up when they are sad. ◆I think it’s a good idea for them to … ◆I came up with this idea because … ◆The story made me think of … ◆I got the inspiration (灵感) from … ◆It is he who inspired me to make a machine called … ◆So it is my hope to do something for them. ◆I have invented a(n) … to help them. ◆In order to help them, I made a(n) … which can … 第三步：介绍这项发明的各项情况【参考句型】 ◆It is as large as … and it looks like … ◆It is designed as a kind of … ◆To make it easy to carry, it’s made of … ◆It can be used as … ◆It is … tall and it weighs … ◆The red … makes it easy to be seen. ◆I believe this machine can help them solve the problem. ◆I hope it is not only a machine but also a … ◆Everyone can use it only if … ◆They will have a happy and safe life as long as they use the machine. ◆With the invention of the …, it is easy for them to … ◆With it, they can have the chance to … ◆The invention allows old people to communicate with people thousands of miles away. ◆It can change the way old people live / watch TV. ◆It also makes old people’s easier because now many things can be done without other s’ help. 【独立写作】

双语平行语料库对齐技术述评

双语平行语料库对齐技术述评对齐的双语语料库在机器翻译、词义消歧和双语词典编撰等领域都非常有用。语料对齐的单位由大到小，有篇章、段落、句子、短语、词等不同的层次。粒度越小，提供的语言信息就越多，应用的价值也就越大。然而平行语料库的自动对齐并非是一件容易的事情。由于语料大都来自人工翻译，句子之间并不都是一对一的翻译模式，还有一对多、多对多的翻译模式。这种复杂性加大了对齐的难度，特别是对更细粒度级别的对齐。由于语言之间存在着差异，找到固定的对应翻译很难，再加上文本预处理工具难以保证处理效果，以及一些电子文本的噪声纷繁复杂，这都增加了对齐的难度。而对于英汉两种差别很大的语言来说，目前的语料库对齐算法并不一定完全适用于汉英语料库的对齐。本文首先回顾了当前国外平行语料库的对齐技术，然后分析了国内在对齐中所使用的技术，旨在为本研究所今后构建小型汉英平行语料库提供一个技术支持。 1 目前平行语料库对齐技术的现状 1.1 句子级对齐技术在各级对齐研究中，其中最为重要且较为成熟的自动对齐技术是句子一级的对齐。句子级对齐的方法主要有三种：①基于长度的方法(length-based)(Brown et al,1991; Gale & Church, 1991a)；②基于词汇的方法(lexical-based)(Kay & Roscheisen, 1993)；③混合法(combination)(Tan & Nagao, 1995; Wu,1994)。基于长度的方法最早是由Brown和Gale提出，虽然他们的算法都是由源文本中句子长度和译文本中的句子长度有很大的正相关这一观察得出，但其侧重点却不同。Brown的算法以词为单位计算句子的长度，而Gale和Church则是以字符为单位计算句子的长度。他们分别用各自的算法对加拿大议会会议所录英法双语语料库进行了对齐实验，准确率达96~97%。然而该方法在处理复杂句子的对齐(如2∶1或2∶2的句子对齐,或非直译和省略的句子)以及不同语系的句子对齐时，准确率却并不高，而且此算法一旦出错，便不可能自动纠正。基于词汇的方法是由Kay和Rosheisen提出的。他们认为最佳的句子对是那些使系统词汇对齐数量最大化的句子。基于词汇的算法虽然可以提高对齐的准确性，但却费时；而且目前还没有充分证明这一方法适合于大型语料库。Chen(1993)对Kay 和 Rosheisen的算法进行了改进，这一算法运用词汇信息构建了一对一词汇统计翻译模型,用这样的翻译模型找到语料库生成的最大可能性。他用此算法对旧的Hansard语料库进行双语对齐。与Brown和Gale的对齐算法相比，这一算法不仅正确率高，而且在处理大量省略的对齐中能轻易确定省略的位置，且鲁棒性(robust)较好。基于词汇方法的另一种做法是利用同源词(cognate)(Church,1993)。此方法在处理英法和英德语言中的诸如名字、日期、数字、术语等可辨认单位出现比率高的情况下效果更好。如前所述，基于词汇的方法相对可靠精确，但计算起来相当复杂且速度较慢；而基于长度的算法模型虽然简单，独立于语言知识和外部资源，但鲁棒性不好，极易造成错误蔓延。由于每种方法都有自己的优缺点，人们试图将各种方法混合起来找到问题的解决途径(Tan & Nagao, 1995; Wu,1994; ;Collier,1998; Vronis，1999；Melamed，2000)。试验结果表明，混合的方法优于单纯使用其中的任何一种方法。

《双语平行语料库在翻译教学上的用途》评述

攻读博士、硕士学位研究生试卷（作业）封面（2016 至2017 学年度第一学期）学号姓名题目《双语平行语料库在翻译教学上的用途》评述课程名称语料库语言学专业英语语言文学入学年月2016年9月培养方式全日制□非全日制

题目:双语平行语料库在翻译教学上的用途。作者:王克非，曾任北京外国语大学外国语言研究所副所长、中国外语教育研究中心常务副主任，现任《外语教学与研究》杂志主编，博士生导师，研究方向为语言学和翻译研究。研究问题:本文以北京外国语大学建成的通用汉英平行语料库为例，探讨如何在翻译教学中运用双语平行语料库、如何处理翻译教学与双语平行语料库的关系、双语平行语料库对译者有何帮助、以及译者如何在翻译教学中运用双语对译检索（词语的对译检索、结构的对译检索和语句语篇的对译检索）时找到合适的对译，提高他们的英语语感，掌握正确的翻译方法。研究方法: 本文根据北京外国语大学中国外语教育研究中心建成的通用汉英平行语料库（3000万字词）为例，探讨它在翻译教学上的用途。首先，本文作者采用了随机抽取的方法对克服（overcome）和找（find）进行了检索，找到了他们不同的翻译方法和用法；然后作者通过举例说明汉语中把字句结构的三种形式如何在英语中翻译；最后作者从台湾大学高建明所建的英汉平行语料库中，以“他心情很低落”为例,从语料库中找到相近的中英文短句、句子,找到了表示“心情低落”的各种不同词汇和方法。结论：在翻译的教学和实践中，双语平行语料库和检索工具的运用不仅给译者提供了方便，而且使他们掌握了一种科学、多样的翻译方法。同时也能激发学生的兴趣，让学生在不同版本的对译中互相学习。这表明双语平行语料库是翻译教学中的一种重要的学习资源，应当引起

旅游汉英双语平行语料库的建设与应用

第33卷第10期湖南科技学院学报 V ol.33 No.10 2012年10月 Journal of Hunan University of Science and Engineering Oct.2012 旅游汉英双语平行语料库的建设与应用肖庚生陈欣（南华大学外国语学院，湖南衡阳 421001）摘要：文章在综述现有旅游语料库的基础上，介绍了自建的衡阳旅游汉英平行语料库的建库步骤，即语料的取样、英译、标注与对齐，并阐述了该库在旅游文本语言特征、旅游翻译、旅游英语及旅游翻译教学研究中的应用价值。该库的建设与应用既能充分满足研究需要，亦能促进导游、翻译等英语人才的培养，进而推动当地旅游产业的发展及跨文化传播。关键词：旅游语料库；双语平行语料库；旅游英语中图分类号：H030文献标识码：A 文章编号：1673-2219（2012）10-0163-03 近30年来，语料库及语料库语言学从无到有、蓬勃发展。基于语料库的语言学及应用语言学研究应运而生，语料库这一研究工具与方法业已广泛应用于词汇、句法、语义、语言对比、词典编撰、二语习得、翻译等领域的研究之中，并取得了累累硕果。[1]为了研究或应用的需要，国内外先后创建了跨学科、多语言、内容迥异、库容不一的众多语料库。近年来，双语平行语料库由于其独特的优势备受关注，其建设与应用正如火如荼地进行。不过，迄今为止，国内外高校与研究机构所研制的平行语料库主要是通用型的双语平行语料库以及文学翻译类型的平行语料库，以某一专门用途为导向的平行语料库仍较为鲜见。此外，基于平行语料库的相关研究主要侧重于对个别语言或翻译现象的探讨。鉴于这一研究现状，我们拟以课题研究为契机，建设衡阳旅游汉英双语平行语料库，在此基础上，力图摸索其在汉语与英语的旅游文本语言特征、旅游汉英翻译、旅游英语与旅游翻译教学研究中的应用。一双语语料库与旅游语料库综述双语语料库最早创建于上世纪90年代中后期，迄今为收稿日期：2012－08－26 基金项目：衡阳市社科基金项目“顺应论视阈下衡阳旅游汉英双语平行语料库的建设与应用研究”（项目编号2011C011）；全国教育科学规划课题“基于语料库的大学英语教学平台建设与研究”（项目编号GPA105029）阶段性成果。作者简介：肖庚生（1980－），男，湖南衡阳人，讲师，应用语言学博士生，主要研究方向为语料库语言学。陈欣（1983－），女，湖南郴州人，讲师，语言学硕士，主要研究方向为翻译理论与实践。止国内外业已建立多种类型的双语平行语料库。早在1995年，曼彻斯特大学研制了世界上首个翻译语料库，主要收集从各国语言翻译成为英文的文本，如今库容已达千万词。但是它并非严格意义上的双语平行语料库，因为它并没有实现双语对齐，只能称其为对比语料库。目前国际上比较知名的平行语料库有挪威的“英语-挪威语平行语料库”、英国的“德语-英语文学文本平行语料库”等等。而由北京外国语大学中国外语教育研究中心于2004年启动创建的“新型双语对应语料库”（含汉英、汉日两个双语平行语料库），库容为3000万词次。其中，汉英双语平行语料库的文本类型主要涵盖人文类、社科类和科技类。该语料库的建设得到了国家社科基金重大规划课题的资助，目前正为1亿词次的超大库容做进一步的扩容努力。此外，国内比较知名的双语平行语料库还包括：李德俊以汉英词典研编为主要目的，主持建设2000万词次的英汉平行语料库；卫乃兴以研究探讨英汉对等表达为目的，主持建设900万词次的英汉平行语料库；哈尔滨工业大学所创建的库容为40万对的英汉双语平行语料库；绍兴文理学院创建的中国古典文学英译双语平行语料库等等。上述双语平行语料库多数以文学文本为主，抑或以收集百科文本（含文学与非文学作品）为特色，而针对某一特定文类或某一地域特色而专门建构的专门用途双语平行语料库仍较为鲜见。近年来，随着交通与通讯技术的日新月异，世界各地人们之间的科技、文化、商务交流、合作与往来日益频繁。更为重要的是，各国人们纷纷走出国门，畅游世界，体验世界各地的异域风情，许多国家的旅游产业获得了飞速发展。为更好地发展旅游产业、传播旅游资讯、吸引外国游客，同时亦为了满足语言学及应用语言学研究需要，旅游专门语料库应运而生。 163

基于语料库的大学生英语作文错误分析

基于语料库的大学生英语作文错误分析胡姝夏 (河南师范大学公共外语部,河南新乡453007) 摘　要:本研究以中介语和错误分析理论为基础,以语料库为手段对河南师范大学非英语专业二年级114名学生作文中的错误进行分析,发现词汇和语法类错误的频率较高,错误的原因主要表现在语内和语外干扰方面。关键词:英语作文;语料库;错误分析;教学建议中图分类号:H319.6 文献标识码:A 文章编号:1009-4970(2008)03-0152-04 收稿日期:2007-12-23 作者简介:胡姝夏(1979-),女,河南漯河人,河南师范大学公共外语部,助教,主要研究方向为应用语言学和英语教学法。写作是一个语言输出的过程,教师可以从中了解学生在某个阶段的英语水平以及教材和教学大纲的可行度。写作又是大学英语教学的重要组成部分。根据中介语和错误分析理论,本研究以语料库为手段对大学非英语专业二年级学生一次习作中的错误进行分析并统计各类错误出现的频率,尝试寻找错误的原因和有效的解决途径,为更好地进行教学和对学生有针对性地进行指导提供建议。一、研究问题和研究对象本文的研究问题可概括为:发现学生习作中易犯的错误;分析错误并讨论原因;探讨大学英语教学过程中提高学生习作的有效途径。受试者为河南师范大学06级接受大学英语教学的两个自然班114名学生(因为实行选课制,学生来自于各个院系),他们以前均接受过计算机基础课的上机培训,熟悉键盘操作。用软件“金山打字通”对他们的英文打字速度进行测试,结果显示他们的打字速度都在每分钟70个字符以上。二、实验材料与研究步骤本研究设计的写作任务是根据往年四级考试中论文的模式拟定的,作文题目为“the Pos itive and N ega2 tive Effec ts of A dve rtisem en ts”,附有汉语的写作大纲:我们的生活充斥着广告;广告对于我们生活的积极影响和消极影响;你的看法。 (1)受试者在老师的监控下用40分钟时间独立完成约120字指定题目的作文。为了客观地测量学生的写作水平,测试过程中网络教室的管理人员切断受试者电脑的网络连接,并对具有纠错功能的一些软件进行了权限设置。 (2)根据四级作文标准由两位老师共同对学生作文进行评分并划分档次,根据对两位老师评分的相关性分析,评分结果比较一致(p<.01),学生作文的分值分布见表1: 表1　作文分值分布分数0-34-67-910-1213-15受试(人)1225392711 百分比(%)10.5%21.9%34.2%23.7%9.7% (3)对各篇作文中的错误进行分析并归类,错误类型的制定参照《中国学习者英语语料库》。 (4)对文本进行错误附码(主要错误类型及其代码见表2) (5)运用Concapp软件计算每种错误出现的频率(错误出现的频率和所占的百分比见表2) 三、作文中常见错误分析此次主要收集学生写作中出现的语言错误,主要错误类型如表2。以下从词汇和句法两方面分析学生写作中所犯的主要错误及错误原因,对于冠词、字母大小写等方面学生可以自行纠正的错误这里不再作讨论。 1.词汇方面的错误 (1)拼写错误学生作文里的拼写错误是多种多样的,除了增减或对调元音、辅音外,还有乱造新词、前后缀混淆、动词不规则形式变化错误等。如:In m o rdensoc ie2 ty,/The re a re a m essof adve rtisem en ts/W e can ge t m assagesfrom/adve rtisem en ts a r2 round ingus/adve rtisem en ts enfluence

中国英汉平行语料库的设计与研制

中国英汉平行语料库的设计与研制王克非北京外国语大学中国外语教育研究中心提要：本文论述超大型双语平行语料库的设计与研制问题。在综合述介国内外双语语料库建设情况之后，作者着重论述了中国英汉平行语料库这一超大型双语平行语料库的设计特点（主要有分类架构、历时处理、语料平衡以及通用的和各种专门语料的采集）和研制方法（主要讲述语料的加工标注、检索平台以及各个专门语料库、历时语料库和口译语料库的构建）。其设计与研制对于其他大型语料库的建设具有借鉴意义。关键词：中国英汉平行语料库；设计；研制 Abstract:The paper deals with the design and construction of asuper-large-scale bilingual parallel corpus.After an overview of parallelcorpora constructions and applications both in China and abroad, the designfeatures(including classification and composition,diachronical arrangement,balance of textual materials,and collection of texts for general or specificpurposes)and the construction methods (including tagging,concordanceplatform,and the construction of specialized corpora,diachronical corpora andinterpreting corpora)of the super-large-scale China English-Chinese ParallelCorpus(CECPC)are focused on.The design and construction discussed areapplicable to the compiling of other large-scale corpora. Keywords:China English-Chinese Parallel Corpus (CECPC);design;construction 1、中国英汉平行语料库的研制意义在全球化、信息化的当今世界，翻译已成为了解全球信息、扩大对外宣传、获取国际资源的重要手段。同计算机技术结合而兴起的双语平行语料库建设，则为语言研究、翻译研究、外语教学、词典编纂和跨语言信息检索等提供了最好的平台，同时还可用来考察和验证基于单语语料库或者基于直觉提出的假设，具有广阔的应用前景。

一带一路视角下中英语料库建设项目报告

一带一路视角下的中英语料库建设项目报告随着“一带一路”战略的提出，中外文化交流日益频繁，这种现象对翻译行业提出了更高的要求。因此，采取有效措施培养优秀翻译人才、提高译员翻译质量刻不容缓。基于此，本项目决定建设一带一路视角下中英语料库以提高翻译质量。本文将着重报告本项目中英语料库建设的背景目的、过程及其作用。一、一带一路视角下的中英语料库建设背景及目的 “一带一路”战略的提出为本项目的开展提供了时代背景。“一带一路”是“丝绸之路经济带”和“21世纪海上丝绸之路”的简称。从古至今，“一带一路”一直是连接东西方文化的重要纽带，尤其是在新的历史时期，“一带一路”战略促进了区域间的人际交往和文化交流。全国政协委员、中国翻译协会常务副会长黄友义在接受专访时曾表示，经济和文化的走出去导致了中译外工作量的增加，但目前中译外人才十分紧缺。而作为覆盖范围及应用领域日益广泛的语料库在提高翻译教学质量、培养优秀译员及促进计算机辅助翻译中发挥着日益重要的作用。目前国内外都已有大量已建成的语料库，如BNC英国国家语料库、美国当代英语语料库、中国学习者英语语料库及中国英语学习者口语语料库等，但针对于“一带一路”战略的语料库较为稀少。本项目的开展旨在抓住“一带一路”战略所带来的发展契机，建设“一带一路视角下的中英语料库”，为“一带一路”战略中相关政策的英译提供便利，从而加强中外交流。青岛农业大学翻译中心的成立及其已承接的翻译活动为本项目的开展提供了专业背景。近年来，翻译中心承接了大量专利翻译、影视字幕翻译等翻译活动，在此过程中，翻译人员遇到了一些问题：如对专利特有名词和英美俗语不够熟悉等。本项目的旨在将翻译学理论、语言学理论及现代计算机技术相结合，通过对大量真实语言数据的研究，将众多科技名词、英语俗语和习语及与英美文化相关的词语收录进语料库当中，将中英双语语料库作为教学手段，方便译者查询、理解及使用相关名词，切实提高其翻译质量。另外，该项目的开展由具有多年翻译经验和教学经验的纪卫宁老师亲自指导，这为本项目的顺利开展提供了重要保障。二、一带一路视角下中英语料库建设过程 (1)语料库建设前期准备

中文平行语料库

中文平行语料库机器翻译需要的平行语料库一库难求，笔者列举了一些免费的中文数据集，可用于中文和其他语言之间的机器翻译。 1.汉英10000平行语料库https://www.doczj.com/doc/049217433.html,/data/14779 10000句对规模的英汉双语句对齐语料库，已经做了分词和句子对齐。 2.汉英22万句对法律类句子对齐语料https://www.doczj.com/doc/049217433.html,/data/14261 22万句对规模的英汉法律类双语句对齐语料。缺点是没有做分词和语言对的对齐，还得做预处理 3.汉英双语句对齐语料库（1500句对）https://www.doczj.com/doc/049217433.html,/data/13290 1500句对规模的英汉双语句对齐语料库。缺点是没有做分词和语言对的对齐，还得做预处理 4.最大开放字幕库OpenSubtitles的多语言平行语料数据 https://www.doczj.com/doc/049217433.html,/data/14469 https://www.doczj.com/doc/049217433.html,是全球最大的开放字幕库，提供了中文、英文、日文、德文、法文等30多种语言的上亿条电影和电视剧字幕。本数据集是根据该网站数据制作的多语言字幕平行语料库，包含30种语言中任意两种语言之间的字幕互译语料。是用于机器翻译研究的绝佳素材。数据量也足够大，压缩后还有2.38G 5.PHP手册的多语言平行语料库 https://www.doczj.com/doc/049217433.html,/data/15045 将PHP手册内容制作了一个包含21国语言的平行语料库。语料库已经被分词，每个语言对都被对齐。数据量压缩后有278M 6.KDE手册的多语言平行语料库https://www.doczj.com/doc/049217433.html,/data/15025 将KDE手册内容制作成一个包含24国语言的平行语料库。语料库已经被分词，每个语言对都被对齐。数据量压缩后有88M

英汉双语平行语料库人工对齐方法说明

英汉双语平行语料库人工对齐方法说明 1．概述半自动英汉双语平行语料库的对齐分为两个过程：第一个过程是先将两种语言的文本分成句子，每个句子占一行。句子定义为：以句号、问号、感叹号、分号结尾的一串字符，或以句号+引号、问号+引号、感叹号+引号等结尾的一串字符。“行”的概念是一串以回车换行符结尾的字符。这个过程可以采用任何一种具有“查找”和“替换”功能的文字处理软件来完成，也可以编程由计算机自动完成。第二个过程是在第一个过程产生的结果的基础上以手工方式将两种语言的文本在句子水平上对齐。这一过程要采用UltraEdit软件来辅助完成。在句子水平上对齐两种语言的文本，除了要注意以上对“句子”和“行”的定义以外，还应遵循一个重要的原则，即：如果两种语言的文本在句子的切分上有差异，应尽量保持原文句子不动，调整译文以适应原文。为了能从双语平行语料库中获取更多的信息，还需要在对齐过程中插入少量的标记，例如：分译标记、合译标记、混译标记和移动标记等。此外，为了便于以后的检索，对于过长的句子还要在适当的地方将长句截短成两个或更多的小句。 2．人工对齐的方法 2.1打开文件先用UltraEdit软件将两个已经分为句子的文本文件打开，在该软件的工具栏的“窗口”下拉菜单中点“水平平铺”选项，使两个打开的文本同时显示在屏幕上。为了操作方便，一般把原文放在上半屏，把译文放在下半屏。（见图1） 2.2 上下移动文本为了能够对齐两种语言的文本，在操作过程中需要不断地上下移动文本。移动文本可以用鼠标移动窗口右边的滑块来完成。也可以将光标放在某一行，然后用鼠标的中间滚轮来上下移动。 2.3 同步移动上下两个窗口中的文本在“窗口”下拉菜单中选“同步”选项，就可以同步移动上下两个窗口中文本，极大地方便人工对齐的操作。

大规模英语语料库的英文句子检索系统

哈尔滨工业大学毕业设计（论文）摘要世界上许多国家长期以来都一直在从事对机器翻译的研究，但目前机器翻译的结果很难达到人们满意的程度。同时，基于双语语料库的句子检索系统由于语料库规模较小而受到很大限制。在这一背景下，我们设计并实现了基于大规模英语语料库的英文句子检索系统(CESRS)。它响应用户输入的汉语句子或短语，依次经过汉语分词转换，句子检索，相似度计算和分类排序等处理模块将与输入相匹配的英文句子返回给用户，为用户提供参考。本文在对系统进行分析之后，对系统中各模块实现时所用的算法及数据结构进行了简要的介绍。例如，分词模块所采用的改进最大匹配算法，句子检索模块中索引所采用的倒排表结构。另外，本文采用基于词的计算相似度的方法，并着重介绍了词语距离的概念，编辑距离的概念以及如何引入编辑距离计算句子相似度。在此基础上，详细介绍了动态规划算法的思想以及动态规划算法在本系统中的应用。同时，还根据分类排序模块中数据结构的转换过程，详细地介绍了此模块所用算法的设计过程及算法执行流程。最后，描述了对系统进行测试的方法及结果，并指出了系统的不足之处和可能的改进措施。关键词大规模英语语料库句子检索相似度编辑距离动态规划分类排序； - -I

哈尔滨工业大学毕业设计（论文） - - II Abstract Many countries in the world have been studying with Machine Translation for a long time. But the current efficiency of MT is difficult to cater to people’s need. At the same time, The Sentence Retrieval System, based on bilingual corpus, is restricted greatly because of the small size of this kind of corpus. So, we make a Chinese to English Sentence Retrieval System (CESRS) which is based on large comparable corpus. After the segment and translation module, the sentence retrieval module, the similarity measuring module and the sorting module, the system will find in corpus sentences which are the most similar to the client’s input, and provides reference to clients. After giving an analysis to CESRS, the article sketches the algorithm and the data structure which will be used in the system. Such as, the maximum matching algorithm used in segment module. The other example is the inverted data structure. In addition, the article adopts a method which is based on words to measure the similarity between two sentences. It illustrates the concept of the word distance in detail, also the concept of edit distance and how to use edit distance to measure the similarity between sentences. The article also introduces the spirit of Dynamic Programming and how to use this algorithm to measure similarity between sentences. Meanwhile, it gets use of the transparent of the data structure of the sorting module to illustrate what algorithm has been used to fulfill this module. At last, it tells a method to evaluate the system and points out some faults of the system and some means to do with these faults. Key words very large English comparable corpus, sentence retrieval, similarity, edit distance, dynamic programming, sorting ；

英汉语料库汇总

1.英语学习者语料库（书面语及口语）中国学习者语料库 CLEC（100万）广外、上海交大 2.大学英语学习者口语语料库 COLSEC (5万) 上海交大 3.香港科技大学学习者语料库 HKUST Learner Corpus 香港科技大学 4.中国英语专业语料库 CEME (148万) 南京大学 5.中国英语学习者口语语料库 SECCL (100万) 南京大学 6.国际外语学习者英语口语语料库中国部分 LINSEI-China (10万) 华南师大 7.硕士写作语料库 MWC (12万) 华中科技大学 9.平行语料库汉英平行语料库 PCCE 北外 10.南大－国关平行语料库南京大学 11.英汉文学作品语料库；外研社 12.冯友兰《中国哲学史》汉英对照语料库 13.李约瑟(Joself Needham)《中国科学技术史》英汉对照语料库 14.计算机专业的双语语料库；国家语言文字工作委员会语言文字应用研究所 15.柏拉图(Plato)哲学名著《理想国》的双语语料库 16.英汉双语语料库(15万对) 中科院软件所 17.英汉双语语料库：LDC香港新闻英汉双语对齐语料36294段以及香港法律英汉双语对齐语料31万句子对中国科学院自动化研究所 18.英汉双语语料库(100万)，网上英汉语段电子词典及网上电子英汉搭配词典(1000万) 东北大学 19.英汉双语语料库(40-50万句子对) 哈尔滨工业大学 20.双语语料库(5万多对) 北京大学计算语言学研究所 21.对比语料库 LIVAC(Linguistic variety in Chinese communities) 香港城市理工大学 22.平衡语料库(Sinica Corpus)；树图语料库(Sinica Treebank) 台湾 23.特殊英语语料库中国英语(China English)语料库河南师范大学 24.军事英语语料库(Corpus of Military Texts) 解放军外语学院 25.新视野大学英语教材语料库上海交通大学 26.汉语语料库汉语现代文学作品语料库(1979年，527万字) 武汉大学 27.现代汉语语料库(1983年,2000万字) 北京航空航天大学 28.中学语文教材语料库(1983年,106万8000字) 北京师范大学 29.现代汉语词频统计语料库(1983年,182万字) 北京语言学院 30.国家级大型汉语均衡语料库(2000万字) 国家语言文字工作委员会 31.《人民日报》语料库(2700万字) 北京大学计算机语言学研究所 32.大型中文语料库(5亿字,10分库) 北京语言文化大学 33.现代汉语语料库(1亿字) 清华大学 34.汉语新闻语料库；(1988年,250万字) 山西大学 35.标准语料库(2000年,70万字) 36.生语料库(3000万字)；《作家文摘》的标注语料库(100万字) 上海师范大学 37.现代自然口语语料库中国社会科学院语言所 38.旅游咨询口语对话语料库和旅馆预定口语对话语料库中国科学院自动化所 39.北京大学汉语语言学研究中心的三个语料库