<?xml version="1.0"?><!DOCTYPE article SYSTEM "/project/take/software/searchbench_offline_processing/paperxml_generator/aclextractor/src/python/../resource/dtd/paperxml.dtd"><article><header><firstpageheader><page local="1"/><title>Erratum to: A Statistical Approach to Machine Translation</title><pubinfo>© 1991 Association for Computational Linguistics</pubinfo><author surname="Brown" givenname="Peter F."></author><author surname="Pietra" givenname="Stephen A. Della"></author><author surname="Jelinek" givenname="Fredrick"></author><author surname="Mercer" givenname="Robert L."></author><author surname="Cocke" givenname="John"></author><author surname="Pietra" givenname="Vincent J. Della"></author><author surname="Lafferty" givenname="John D."></author><author surname="Roossin" givenname="Paul S."></author></firstpageheader><frontmatter><p><b>Erratum to: A Statistical Approach to Machine Translation</b></p><p>Peter F. Brown Stephen A. Delia Pietra Fredrick Jelinek Robert L. Mercer</p><p>John Cocke Vincent J. Delia Pietra John D. Lafferty Paul S. Roossin</p></frontmatter><abstract>In Section 6 of "A statistical approach to machine translation" <b><i>(Computational Linguis­tics </i></b>16(2), 79-85), we reported the results of two experiments in which we estimated parameters of a statistical model of translation from English to French. In the first experiment, the English and French vocabularies each consisted of 9,000 common words, and the model parameters were estimated from 40,000 pairs of sentences 25 words or less in length. Words outside the 9,000-word vocabularies in these sentences were mapped to special <b><i>unknown </i></b>words. In the second experiment, the vocabularies were limited to 1,000 common English words and 1,700 common French words, and the model parameters were estimated from 117,000 pairs of sentences 10 words or less in length that were completely covered by the respective vocabularies. In Figures 4, 5, and 6 of the paper, we erroneously presented parameter estimates from the 1,000-word experiment, while claiming in the text that they were from the 9,000-word experiment. The parameter estimates for these two experiments differ con­siderably because of the restriction of the training corpus in the 1,000-word experiment to short, covered sentences. For example, the probability that <b><i>hear </i></b>is translated as <b><i>bravo</i></b> </abstract></header><body><section title="Figure 4"><p><b>Probabilités for <i>the.</i></b></p><table class="main" frame="box" rules="all" border="0" regular="False"><tr class="row"><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p></p></td><td class="cell"><p><b>English: <i>the</i></b></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>French</b></p></td><td class="cell"><p><b>Probability</b></p></td><td class="cell"><p><b>Fertility</b></p></td><td class="cell"><p><b>Probability</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>le</b></p></td><td class="cell"><p><b>.443</b></p></td><td class="cell"><p><b>1</b></p></td><td class="cell"><p><b>.856</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>la</b></p></td><td class="cell"><p><b>.207</b></p></td><td class="cell"><p><b>0</b></p></td><td class="cell"><p><b>.140</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>les</b></p></td><td class="cell"><p><b>.184</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p>r</p></td><td class="cell"><p><b>.097</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>ce</b></p></td><td class="cell"><p><b>.018</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>il</b></p></td><td class="cell"><p><b>.012</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td></tr></table><page local="2" global="326"/></section><section title="Figure 5"><p><b>Probabilities for <i>not.</i></b></p></section><section title="Figure 6"><p><b>Probabilities for <i>hear.</i></b></p><p>is .992 in the 1,000-word experiment (see Figure 6 of the paper)<footnote anchor="1"/>, while it is only .808 in the 9,000-word experiment (see Figure 6 above). This difference is due to the fact that the sentence pair <b><i>(Hear, heart \ Bravo!) </i></b>is extremely common in our data and is completely covered by the 1,000-word and 1,700-word vocabularies.</p><p>Figures 4, 5, and 6 contain the parameter estimates from the 9,000-word experi­ment. Only probabilities greater than or equal to .01 are reported.</p><p><b>1 We thank Ken Church for pointing out that this estimate is not consistent with the frequency with which <i>hear </i>translates to <i>bravo </i>in other data from the same source.</b></p><table class="main" frame="box" rules="all" border="0" regular="False"><tr class="row"><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p></p></td><td class="cell"><p><b>English: </b><i>not</i></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>French</b></p></td><td class="cell"><p><b>Probability</b></p></td><td class="cell"><p><b>Fertility</b></p></td><td class="cell"><p><b>Probability</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>ne</b></p></td><td class="cell"><p><b>.482</b></p></td><td class="cell"><p><b>2</b></p></td><td class="cell"><p><b>.728</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>pas</b></p></td><td class="cell"><p><b>.455</b></p></td><td class="cell"><p><b>0</b></p></td><td class="cell"><p><b>.153</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>non</b></p></td><td class="cell"><p><b>.029</b></p></td><td class="cell"><p><b>1</b></p></td><td class="cell"><p><b>.114</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>rein</b></p></td><td class="cell"><p><b>.012</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td></tr></table><table class="main" frame="box" rules="all" border="0" regular="False"><tr class="row"><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p></p></td><td class="cell"><p><b>English: </b><i>hear</i></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>French</b></p></td><td class="cell"><p><b>Probability</b></p></td><td class="cell"><p><b>Fertility</b></p></td><td class="cell"><p><b>Probability</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>bravo</b></p></td><td class="cell"><p><b>.808</b></p></td><td class="cell"><p><b>1</b></p></td><td class="cell"><p><b>.527</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>entendre</b></p></td><td class="cell"><p><b>.079</b></p></td><td class="cell"><p><b>0</b></p></td><td class="cell"><p><b>.472</b></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>entendu</b></p></td><td class="cell"><p><b>.026</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>entends</b></p></td><td class="cell"><p><b>.024</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"><p><b>entendons</b></p></td><td class="cell"><p><b>.013</b></p></td><td class="cell"><p></p></td><td class="cell"><p></p></td><td class="cell"></td></tr><tr class="row"><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td><td class="cell"></td></tr></table></section></body></article>