一篇探讨机器翻译历史、现状与未来的文章,提及巴别鱼等虚构概念及多邻国等现实应用,文章本身也由机器翻译辅助人工编辑完成。
一篇探讨机器翻译历史、现状与未来的文章,提及巴别鱼等虚构概念及多邻国等现实应用,文章本身也由机器翻译辅助人工编辑完成。
早期机器翻译采用基于规则的方法,目标是让计算机掌握多语言词汇与语法实现自主翻译;1954年IBM 701用此方法翻译俄语化学句,1976年加拿大气象系统用于法英天气预报,但语法问题导致资金削减,后被统计方法取代。
1954年,IBM 701将49个关于化学的俄语句子翻译成英语,这是最早的非数值计算机应用之一。该机器占据IBM纽约总部两个房间,初期引发兴奋,但因语法问题和缺乏纠正机制导致美国政府削减资金,开启20年相对沉默期。
1992年CompuServe上线首个在线机翻服务,向订阅用户提供论坛内容从英语到德语的翻译,开启了机翻从桌面走向网络民用服务的阶段。
本文中Neurogrid是斯坦福大学Kwabena Boahen研发的模拟大脑皮层工作的硬件平台。作者用它对比人类大脑与人工处理器的能耗差距:人脑约耗10瓦,而模拟人类智力水平的处理器需约10兆瓦,相当于一座中型发电站的输出。这一对比服务于讨论图灵式智能模拟的现实瓶颈。
1997年AltaVista推出BabelFish服务,支持英、德、法、西、葡、意六种语言免费互译,大幅降低大众使用门槛,但仍面临词义消歧和语义准确性难题。
本文指出图灵测试由阿兰·图灵提出,用于判定机器是否能表现出与人类相当的智能行为,核心任务是用自然语言与人交谈。作者强调至今仍无机器通过该测试,并以此说明当前机翻系统与真正智能的距离。
本文把N-gram定义为统计机器翻译中使用的2至3个单词的小词组。系统通过在平行语料中搜索这些词组的对应顺序来建立翻译规则,从而绕过语法指导,直接从数据中学习模式。
本文指出Kashida是阿拉伯文排版中用于对齐行长的特殊方式,它通过拉伸字符本身而非字间距来保持文本颜色均匀,属于机器翻译后人工排版需考虑的文化差异细节。
本文介绍Noto是谷歌为支持全球每种自然语言而开发的通用字体系列,目前已覆盖30种不同文种、包含100多款字体,旨在解决翻译文本在排版中的统一显示问题。
本文中统计机器翻译是谷歌翻译采用的方法,通过分析大量平行文本发现统计模式实现翻译,无需人工编写规则。系统将句子拆分为n-gram来提取对应关系,优点是自主学习,但作者批评它难以处理整体语义与文化语境。
本文指出Skype Translator是微软2014年展示的突破性产品,能对Skype视频通话进行超过45种语言的实时翻译,体现了当时语音机翻向消费级应用推进的趋势。
本文中 reCAPTCHA 是 Luis von Ahn 开发的验证系统,用户需识别计算机无法辨认的扫描文本以证明人类身份,同时帮助提升图书数字化准确率。该项目是 von Ahn 在创办多邻国前的成果,体现了通过人类输入数据训练机器的思路,与机翻改进主题直接相关。
本文中多邻国是由Luis von Ahn开发的免费语言学习应用,被定位为“翻译互联网”的工具。用户在达到较高熟练度后会参与真实文本翻译,其累积成果经算法处理后形成商业版翻译,借游戏化激励用户持续贡献数据以改善机器翻译质量。
道格拉斯·亚当斯小说中的虚构生物巴别鱼具备通用同声传译能力;1997年Altavista推出的在线翻译服务以其命名,首次向大众免费开放英语等六种语言互译,但仍面临语义消歧难题。
本文将谷歌翻译描述为基于统计机器翻译的在线服务,目前覆盖约80种语言。它依靠海量平行文本训练,用户可提交改进建议以优化结果。作者指出其在科技文本上表现较好,但在文化或口语化内容上仍存在明显局限。
1960年Bar-Hillel在论文中以“小约翰找玩具盒,pen里找到了”为例,论证全自动高质量翻译不可行,指出机器缺乏文本外常识无法解决歧义问题。
本文指出图灵测试由阿兰·图灵提出,用于判定机器是否能表现出与人类相当的智能行为,核心任务是用自然语言与人交谈。作者强调至今仍无机器通过该测试,并以此说明当前机翻系统与真正智能的距离。
1947年3月,洛克菲勒基金会主管Warren Weaver致信Norbert Wiener,提出翻译问题可能等同于密码学问题,这一观点直接启发了战后政府资助的早期机器翻译研究。
阿兰·图灵参与二战解码机器研发;1949年在Manchester Mark 1中加入随机数发生器以模拟大胆猜想,并提出图灵测试,强调可靠机器未必智能的观点,对机器翻译理论产生影响。
本文中Smartling为基于云计算的企业翻译管理公司,其副总裁Nataly Kelly指出,统计式机器翻译因依赖陈旧语料库而容易延续历史性别偏见,例如将工程师默认译为男性形式,忽略女工程师或男护士等表述。
本文引用格式塔理论说明仅检查部分无法理解整体,用以批评统计机器翻译仅依赖n-gram局部模式而忽略句子整体含义的缺陷。作者认为这一方法论问题导致机翻在语义和文化层面持续出现偏差。
本文将谷歌翻译描述为基于统计机器翻译的在线服务,目前覆盖约80种语言。它依靠海量平行文本训练,用户可提交改进建议以优化结果。作者指出其在科技文本上表现较好,但在文化或口语化内容上仍存在明显局限。
本文作者Julia Errens追溯了从图灵时代到谷歌翻译的机器翻译发展历程,梳理了早期政府资助项目、基于规则的系统演进,以及统计方法兴起的脉络,强调机器翻译从军事应用转向民用服务的轨迹。
1960年Bar-Hillel在论文中以“小约翰找玩具盒,pen里找到了”为例,论证全自动高质量翻译不可行,指出机器缺乏文本外常识无法解决歧义问题。
控制论学家Norbert Wiener收到Warren Weaver 1947年的来信,信中讨论战时机器解码成果与翻译问题的关联,推动了将密码破译技术应用于机器翻译的思路。
1947年3月,洛克菲勒基金会主管Warren Weaver致信Norbert Wiener,提出翻译问题可能等同于密码学问题,这一观点直接启发了战后政府资助的早期机器翻译研究。
阿兰·图灵参与二战解码机器研发;1949年在Manchester Mark 1中加入随机数发生器以模拟大胆猜想,并提出图灵测试,强调可靠机器未必智能的观点,对机器翻译理论产生影响。
本文引用格式塔理论说明仅检查部分无法理解整体,用以批评统计机器翻译仅依赖n-gram局部模式而忽略句子整体含义的缺陷。作者认为这一方法论问题导致机翻在语义和文化层面持续出现偏差。
本文作者Julia Errens追溯了从图灵时代到谷歌翻译的机器翻译发展历程,梳理了早期政府资助项目、基于规则的系统演进,以及统计方法兴起的脉络,强调机器翻译从军事应用转向民用服务的轨迹。
1954年,IBM 701将49个关于化学的俄语句子翻译成英语,这是最早的非数值计算机应用之一。该机器占据IBM纽约总部两个房间,初期引发兴奋,但因语法问题和缺乏纠正机制导致美国政府削减资金,开启20年相对沉默期。
1985年欧盟委员会推出的Eurotra项目,是当时西方最大规模的基于规则机翻努力,目标是实现欧洲经济共同体九种官方语言之间的互译,标志机翻从军事转向民用领域。
1992年CompuServe上线首个在线机翻服务,向订阅用户提供论坛内容从英语到德语的翻译,开启了机翻从桌面走向网络民用服务的阶段。
本文中Neurogrid是斯坦福大学Kwabena Boahen研发的模拟大脑皮层工作的硬件平台。作者用它对比人类大脑与人工处理器的能耗差距:人脑约耗10瓦,而模拟人类智力水平的处理器需约10兆瓦,相当于一座中型发电站的输出。这一对比服务于讨论图灵式智能模拟的现实瓶颈。
本文中Smartling为基于云计算的企业翻译管理公司,其副总裁Nataly Kelly指出,统计式机器翻译因依赖陈旧语料库而容易延续历史性别偏见,例如将工程师默认译为男性形式,忽略女工程师或男护士等表述。
本文提到SYSTRAN是机器翻译领域的巨头,三星为其收购以保持自身产品在实时翻译方面的领先地位,反映了商业公司对机翻技术的争夺。
本文将 Viki 描述为粉丝驱动的在线视频平台,志愿者团队为韩剧等内容制作 200 多种语言字幕,靠社区认可和无地域限制观看激励参与。Viki 展示了一种无需付费、依靠热情的众包翻译模式,与机翻辅助人工的未来方向形成对比,强调文化细微差别的保留。
本文中多邻国是由Luis von Ahn开发的免费语言学习应用,被定位为“翻译互联网”的工具。用户在达到较高熟练度后会参与真实文本翻译,其累积成果经算法处理后形成商业版翻译,借游戏化激励用户持续贡献数据以改善机器翻译质量。
道格拉斯·亚当斯小说中的虚构生物巴别鱼具备通用同声传译能力;1997年Altavista推出的在线翻译服务以其命名,首次向大众免费开放英语等六种语言互译,但仍面临语义消歧难题。
可左右滑动查看