Skip to content

WARNING

本页面由 Gemini 机器翻译。

使用入门

SheepLint 是一款利用人工智能进行翻译质量检查(QA)的专业工具。它以双语对齐文件(XLIFF、XLSX 等)为输入,并自动将数据拆分为 AI 最易准确理解的适度大小(分块/Chunking),从而实现远高于直接投喂整篇原始文档的审校精度。

此外,它还支持注入翻译记忆库(TM)数据,或将相似句段归类后批量发起请求,实现对照历史译文与上下文的高水准校验。

输入与输出处理流程

SheepLint 宛如一条自动化处理流水线。对输入的文件依次执行以下处理,最终将审校结果汇总导出为 TXT、CSV 或 XLSX 格式。

1. 数据读取与解析

首先将文件解析为由“原文”、“译文”与“上下文说明”构成的结构化文本信息。 支持的文件格式如下:

  • XLIFF
  • MXLIFF (Phrase)
  • MQXLIFF (memoQ)
  • Excel(A列:原文,B列:译文,C列:补充说明/上下文)
  • CSV(列结构同 Excel)
  • Word(从 Phrase / memoQ / Xbench 导出的双语对照表格)
  • JSONL(专有结构化格式)

文件必须为上述双语对齐格式。 如果翻译工作是在常规 Office 文档中进行的,则需要使用对齐工具先将其整理为双语对照形式。

不过,考虑到现代 AI 可处理的上下文宽度,无需像制作严谨 TM 那样进行极度精细的逐句对齐。为此,我们提供了能够按“段落”或“幻灯片页”等粗粒度快速对齐的配套工具 SheepGroom

2. 解析与结构化转换

文本提取完成后,系统会进一步对文本进行结构化转换与切分,使其达到 AI 最易理解的状态。

转换格式包括便于人类阅读核对的 CSV 格式(编号、原文、译文、上下文),以及适合 AI 高效解析的 JSONL 格式。 对于普通校对,CSV 格式即可胜任;但若涉及 TM 匹配计算、复杂上下文注入或将相似句段聚类审校,推荐使用 JSONL 格式。

3. 获取审校结果

数据解析完毕后即可正式提交至 AI 模型。SheepLint 采用 Google 旗下的企业级云平台 Vertex AI

依托 Vertex AI 卓越的企业级安全性与高可用性,能够安全、合规且稳定地完成 AI 驱动的专业文本质检。