YiCAT大模型机翻引擎英译中能力横评:谁最接近“母语表达”?
上一篇我们系统测评了Kimi K2.5、Qwen3.5-Plus、GLM-5、MiniMax M2.5、Gemini 3 Pro、GPT-5.3这6款大模型机翻引擎调用YiCAT自定义AI翻译提示词产出的译文在科技、医药、文学、营销和政经5大领域「中译英」方向的表现。
👉 点击这里回顾《YiCAT平台哪款机翻模型是中译英王者?五大领域六大模型,真实盲测结果来了!》
本篇,我们将视角反转,聚焦这些大模型在各场景的「英译中」能力。
与中译英不同,英译中更考验模型在准确度与流畅度之间的平衡能力,尤其是在专业文本与复杂句式中,差异会被明显放大。
👉 本次测评延续与中译英评测相同的方法与评估体系,由五位CATTI二级笔译及以上能力的盲审员,对6个模型在5大领域的英译中译文进行准确度(Adequacy)与流畅度(Fluency)双维度打分,最终得分取两个分值的平均分。
一起来看6个模型的表现如何——
🧪 测评设计
本次测评延续上一篇的评估框架(包含Adequacy与Fluency两大核心维度),并覆盖科技、医药、文学、营销和政经5个典型场景,确保结果具备横向可比性。
语言方向
英译中,每段200-300词/字
测评模型
Kimi K2.5、Qwen3.5-Plus、GLM-5、MiniMax M2.5、Gemini 3 Pro、GPT-5.3
测评场景(5大领域)
·🔬 科技:节选自Tesla《2024+ MODEL 3 OWNER'S MANUAL》
·💊 医药:选自《Soluble epoxide hydrolase: A potential target for metabolic diseases》摘要
·📖 文学:节选自Gretel Ehrlich的《The Solace of Open Spaces》
·📣 营销:节选自Apple官网产品营销文案
·🏛️ 政经:节选自《The Economics of Peace: Exploring the Interplay between Economic Stability, Conflict Resolution and Global Prosperity》
📊 核心结果
🏆 综合能力排名▼

🌡️ 综合场景能力热力图▼

🏆 准确度排名▼

🌡️ 准确度场景能力热力图▼

🏆 流畅度排名▼

🌡️ 流畅度场景能力热力图▼

🔍 关键发现
📌 发现1:Qwen3.5-Plus在本次英译中方向的表现同样突出
在准确度、流畅度两项核心指标中,Qwen3.5-Plus均拿下第1名,综合得分4.51分。
从场景热力图可见,其在科技、医药、文学、营销、政经5大领域的准确度、流畅度表现全面均衡,无明显弱项。
结合上一篇中译英结果可以看到,其优势并非单向,而是体现在中英双向翻译能力的整体提升。这可能与其在3.x版本中持续强化双语语料训练与优化跨语言能力有关。类似趋势也可在OpenCompass、SuperCLUE等综合评测中得到侧面印证。不过,这类评测并非专门针对翻译任务,相关结论仍需更多专项测评进一步验证。
📌 发现 2:Kimi K2.5成“文学场景王者”,流畅度表现实现反超
综合排名稳居第2,在准确度维度与Gemini 3 Pro并列,流畅度维度直接跃升至第2名。
核心亮点在文学场景:流畅度得分4.64分,为全模型全场景最高分,同时医药、政经场景的准确度也表现突出。
📌 发现3:海外模型稳定性分化,Gemini 3 Pro综合能力优于GPT-5.3
Gemini 3 Pro综合排名第3,准确度维度排名第2,仅在流畅度维度下滑至第3,整体表现稳定。
GPT-5.3 综合排名第5,受限于文学场景的严重短板,导致整体排名大幅下滑,仅在科技、医药场景的准确度保持第一梯队水平。
🧩 典型案例对比
科技领域案例
原文(科技):...open the trunks and charge port door.
MiniMax M2.5译文:
打开后备箱和充电口盖
GPT-5.3译文:
打开前备箱、后备箱和充电接口盖
结论:原文trunks在Model 3语境下包含前备箱+后备箱,MiniMax M2.5存在信息遗漏、安全与使用误导问题,“充电口盖”过于口语化;GPT5.3准确译为前备箱、后备箱,匹配特斯拉车型结构,专业准确度更高,“充电接口盖“表述更标准。
文学领域案例
原文(文学):They are fugitive-looking, perched on a barren, windblown bench, or tagged onto a river or a railroad…
GLM-5译文:
它们看起来行迹匆匆,或是栖息在荒凉多风的长凳状高地上,或是依附在河流或铁路旁……
Qwen3.5-Plus译文:
它们看上去仿佛匆匆过客,或栖身于荒凉风蚀的高台之上,或依附于河流与铁路之畔……
结论:GLM-5直译度高,忠于原文结构,“长凳状高地” 略显直白,少了一点文学感。整体偏叙述,文采和意境稍弱。Qwen3.5-Plus文学感极强,用词典雅,非常贴合文学文本调性。“高台之上”“之畔” 意境更足。句式凝练,节奏感好。
政经领域案例(一)
原文(政经):In the tapestry of global dynamics, conflict resolution emerges as a linchpin method for sustaining prosperity.
GPT-5.3译文:
在全球动态的复杂织锦中,冲突解决作为维持繁荣的关键机制而凸显。
Qwen3.5-Plus译文:
在全球动态的复杂图景中,冲突解决已成为维系繁荣的关键机制。
结论:GPT-5.3的译文“全球动态的复杂织锦”在中文政经语境中显得不合时宜,翻译腔明显。“作为……而凸显”有点英文语序痕迹,略僵硬。Qwen3.5-Plus的“复杂图景”采用意译的策略,整句表达自然流畅,可读性高。
政经领域案例(二)
原文(政经):The spectre of conflict deters investments, both domestic and foreign, due to uncertainties surrounding security and stability.
Gemini 3 Pro译文:
由于围绕安全与稳定的不确定性,冲突的阴影阻碍了国内和国外的投资。
Qwen3.5-Plus译文:
冲突的阴影会阻碍国内和外国投资,其原因在于安全和稳定方面的不确定性。
结论:Gemini 3 Pro的译文结构受限于原文,可读性较差。“围绕安全与稳定的不确定性”是明显英文句法直译,不自然。Qwen3.5-Plus先说结果,再解释原因,可读性略优于Gemini,但措辞仍瑕疵,比如“外国投资”。
营销领域案例(一)
原文(营销):...unlocking a world of powerful features.
MiniMax M2.5译文:
......解锁强大功能的世界。
Gemini 3 Pro译文:
......解锁一系列强大的功能。
结论:MiniMax M2.5直译为“解锁强大功能的世界”,典型欧化句式,生硬且不符合中文科技产品文案的表达逻辑;Gemini 3 Pro译为“解锁一系列强大的功能“,简洁、利落,是苹果官方中文惯用的表达风格,语感自然流畅。
营销领域案例(二)
原文(营销):And they’re even more amazing when used together.
GPT-5.3译文:
当它们协同使用时,更是精彩加倍。
Kimi K2.5译文:
搭配使用,更是相得益彰。
结论:GPT-5.3的“协同使用”,少了一点科技产品的营销感。Kimi K2.5简洁高级,很接近苹果官方中文文案风格。
医药领域案例
原文(医药):....including the effects of its eicosanoid products from both omega-3 and omega-6 PUFAs, in various metabolic diseases
MiniMax M2.5译文:......包括ω-3和ω-6多不饱和脂肪酸产生的二十碳烷酸产物在各种代谢性疾病中的作用。
Qwen3.5-Plus译文:......包括其催化omega-3和omega-6多不饱和脂肪酸所生成的类二十烷酸产物在各种代谢性疾病中的作用。
结论:MiniMax M2.5将“eicosanoid”误译为二十碳烷酸,属于术语错译(“二十碳烷酸”为“eicosanoic acid”),漏译“its”,导致语义主体模糊;Qwen3.5-Plus将“eicosanoid”译为“类二十烷酸”,是生物医学领域标准规范译名,补充“催化......所生成”,逻辑严密、表述完整。
🎯 选型建议
场景 | 推荐模型 |
|---|---|
科技 | GPT-5.3、Qwen3.5-Plus、Gemini 3 Pro |
医药 | Kimi K2.5、Qwen3.5-Plus、GLM-5 |
政经 | Qwen3.5-Plus、Kimi K2.5、Gemini 3 Pro |
文学 | Kimi K2.5、Qwen3.5-Plus |
营销 | Gemini 3 Pro、GLM-5、Qwen3.5-Plus |
👉 如果你还在纠结:
不同模型到底该怎么选?如何根据业务需求快速对比各模型翻译效果并做出准确决策?
我们已经把这套方法做成了一支更直观的视频,帮你找到最适合你的模型:🎥
关于本次测评说明:我们已在多场景覆盖、盲审机制的基础上,尽可能保证结果的客观性与可靠性。但受限于样本规模及模型持续迭代,相关结论更适合作为阶段性参考。如果你有长期使用需求,建议持续跟踪模型表现变化。我们也会不定期更新测评,帮你及时获取最新结果。
💬 也想听听你的实际体验:
👉 你目前最常用哪个翻译模型?
👉 主要用在什么场景?
👇欢迎在评论区交流
YiCAT官网🌍:www.yicat.vip




