暂无笔记结果
很务实的一篇分享,就是图表画得有点抽象。游戏中散落各处的文本一般比较杂乱,分类、场景和上下文都需要比较细致的考量。虽然依旧使用 RAG 读写术语库,但是结合了适合翻译指标的 rerank(比较类似 BLEU / COMET 指标)。评估阶段也是用 BLEU / COMET 做回归,并建立 agent 取代人工评估的工作量。看起来还会自训练质检模型。在某些语种中,取得了不错的结果。
本文中LLM指大语言模型,是哔哩哔哩游戏算法团队构建的游戏本地化翻译体系核心。通过RAG检索增强、自动术语挖掘和质量评估模型,LLM实现术语与上下文一致性翻译,支持10种语言同时处理。相比传统方案,翻译周期缩短85%以上,成本节省70%~80%,专家得分提升50%,线上客诉控制在万分之一内。
本文中CAT指计算机辅助翻译工具,是传统游戏本地化翻译流程的核心辅助手段。译者借助CAT结合术语库和记忆库完成初稿,再经多轮人工审校与LQA质检。面对大体量快迭代的出海项目时,CAT虽能提升部分一致性,但整体仍存在成本高、周期长、历史资产利用不足的局限。
本文中Trados是CAT工具的具体示例,应用于传统游戏本地化流程的辅助翻译环节。它利用记忆库复用历史译文,结合术语规范提升效率。然而面对游戏文本中的变量和风格漂移问题时,基于字符串匹配的效果有限,仍需大量人工干预。
本文中LQA指Localization Quality Assurance(本地化质量保证)。传统流程最后一步由专业LQA专家进行交付前质检,新体系生产阶段则采用规则后检查+LQA专家审校结合的方式。AI+人工混合模式将线上客诉控制在万分之一内,且大模型翻译后的LQA专家修改率显著低于传统供应商方案。
本文中Smartcat是CAT工具的具体示例,在传统翻译流程中用于初稿生成与术语管理。它帮助团队统一风格指南,但整体流程仍面临供应商依赖强、周期长达2个月以上、年度成本达千万级等问题,无法满足快迭代出海需求。
COMET与BLEU同为传统自动评估指标,用于本文测试阶段的初步筛选和多轮评估迭代。它能快速过滤低质翻译,但同样存在高分区间区分度不足的问题,无法完全替代TQE专家对游戏本地化质量的细粒度判断。
本文在翻译模型优化和质量评估两处应用RLHF思路。在自训练翻译模型中采用GRPO等方法进行人类反馈优化;在LLM-as-Judge模型训练中与SFT结合,利用历史TQE数据让模型学习多维度质量判断标准。该方式有效提升了翻译一致性和评估准确性,降低了人工依赖。
本文将其作为翻译质量治理第三层,构建基于LLM的本地化质量评估模型。使用历史TQE数据建立覆盖准确性、语言质量和本地化适应性的三维标注体系,结合细粒度错误分类和上下文信息训练模型。该方案已为特定项目和语种定制使用,显著提升质量评估效率与准确性,部分替代人工TQE流程。
本文将SFT与RLHF结合,用于训练LLM-as-Judge质量评估模型。通过历史TQE评估数据构建训练样本,模型在多维度标注和细粒度错误分类基础上完成有监督微调。该训练方式帮助模型学习专家评估逻辑,已在特定项目中投入使用以提升评估效率。
BLEU是传统自动评分指标,在本文评估层测试阶段与TQE人工打分结合使用。在质量治理中先通过BLEU/COMET初筛,再由TQE专家详细评估。但其在高分区间难以区分业务场景下的译文优劣,因此需配合更智能的评估方法。
本文在自训练翻译模型模块中采用指令微调方法。针对游戏翻译场景设计支持术语库、记忆库和场景上下文的多输入指令模板,同时构造包含术语约束、风格要求和上下文信息的训练样本,提升模型在复杂翻译任务中的表现。该方法与RAG检索结合,共同保障术语一致性和上下文连贯性。
本文在LLM-as-Judge模型中采用思维链推理模式。模型通过逐步分析准确性、语言质量、本地化适应性等每个质量维度,输出详细评估过程,从而提高翻译质量评估的可靠性。该方法整合了原文、机器译文、专家评价和修正译文等完整信息,增强了评估结果的可解释性。
TQE指Translation Quality Estimation(翻译质量估计)。评估层测试阶段采用BLEU分数+TQE人工打分,生产中作为复杂问题的人工详细评估环节。历史TQE反馈用于迭代优化翻译模型,并作为训练数据构建LLM-as-Judge自动化评估系统,以降低人工成本并提升一致性。
本文在强化学习优化环节使用GRPO方法。针对游戏翻译中的常见规则和质量要求,采用GRPO等基于人类反馈的强化学习方式进行优化,并基于翻译质量、术语一致性、风格匹配等多维度构建奖励函数。该技术应用于自训练翻译模型,以提高生成译文的稳定性和专业性。
混合检索是RAG术语检索模块的核心实现方式,包含查询通用术语库、场景相关术语动态加权以及IP关键术语精确匹配三部分。针对技能描述、剧情对白等不同文本类型调整权重,确保专有名词翻译一致性,是保障游戏本地化术语统一的关键技术组件。
RAG即检索增强翻译(Retrieval-Augmented Generation),是算法层核心模块。通过术语检索和记忆库检索为LLM提供上下文,解决游戏翻译中术语不一致、风格漂移和剧情断裂问题。采用混合检索与多因子重排序打分,覆盖系统、技能、剧情等多类文本,使专家得分提升50%。
本文中MemoQ是CAT工具的具体示例,用于传统游戏翻译的初稿阶段。它通过术语库和记忆库辅助译者处理界面、技能、剧情等文本,保证一定一致性。但在百万字级项目中,仍需依赖人工多轮修订,无法解决成本与效率瓶颈。
本文中的哔哩哔哩指公司主体,其游戏算法团队针对海外游戏本地化需求,开发了基于LLM的四层翻译平台。该平台处理全年百万字任务,支持系统、技能、剧情等多类型文本翻译,实现全球多语种同步发布。实际落地后,翻译效率提升7倍,年度维护成本大幅降低,解决了质量不稳定与历史资产利用不足的问题。
可左右滑动查看