截图里可能有电话号码。PDF 里可能有一段文字。复制的文本可能包含五个空行。下一步通常很小。
找到文字。翻译文字。清理文字。编辑文字。
保留原文用于比较。Syzygy 把这些步骤围绕同一个剪贴板条目组织起来:OCR 处理像素,翻译处理语言。
AI 处理已配置的辅助操作。文本工作台(TextWorkbench)处理可重复的文字操作,编辑会创建新的历史记录快照。
工具要说明自己需要什么
按钮名称本身不够。OCR 需要图片或渲染图,翻译需要源文本,AI 需要配置和允许的输入。
文本工作台(TextWorkbench)需要完整的语义源内容,外部编辑需要本地文件。内容计划会说明可用能力,运行时会检查前置条件。
界面会显示等待状态,后端会做最终校验。这套顺序让已禁用动作有清楚原因。 它也避免半成品结果被当作完成的编辑。
OCR 从最好的可用文字开始
PDF 经常带有文字层。Syzygy 会先读取这层文字。图片没有文字层,服务会准备图片用于识别。
大图片可以先缩放。服务把图片送到 PaddleOCR 或 Tesseract,收到文字和边界框后映射回原始坐标。
服务提供方返回语言信号时,结果可以按语言分组。结果会保存为结构化 OCR 记录,搜索索引使用其中的文字字段,预览使用其中的坐标。
原始图片保持不变。
PDF 为什么先提取文字
文字型 PDF 已经暴露字符。把页面渲染后再 OCR 会增加成本。内嵌文字提取更快。扫描 PDF 可能没有文字层。
服务才会渲染限定页数。当前默认处理前两页,PDF 上限是 32 MiB。这个限制保护桌面免受误传大文件影响。
它也让延迟更容易解释。OCR 结果补充 PDF,但不会重写 PDF 文件。
OCR 缓存键让结果可复现
同一张图片可以使用不同语言,同一种语言可以使用不同服务提供方。新引擎可能产生不同边界框,新的缩放上限也可能改变检测结果。
所以缓存键包含内容哈希值、服务提供方、语言和像素上限。
它还包含引擎标识和坐标版本。任意一项变化都会选择新的缓存条目。缓存还使用 TTL。
缓存还使用最大条目数,过期条目不会改动历史记录。
翻译使用配置,而不是隐藏默认值
创建翻译配置,选择服务提供方、源内容语言和目标语言。
测试配置。在翻译面板中选择配置。面板检查源内容,并检查目标语言。
它检查翻译能力和本地化状态,发送有限长度的文字,并报告服务提供方错误。
它返回翻译结果。源内容仍然可用,翻译文字可以变成新的快照,用户决定复制还是编辑。
集合需要先选择源文件
一个集合可以包含多个文件。翻译面板不能猜测你想翻译哪个文件。先选择文件条目,确认它的内容家族。
确认源内容已经在本地,选择语言对并执行翻译。结果属于选中的源内容。
同名文件仍然保持不同。内容哈希值和出现位置标识选中的文件。
AI 使用同一套边界
AI 配置保存服务提供方配置。它可以测试配置、列出可用模型并执行允许的动作。
AI 自动加标签返回建议。用户选择最终标签,普通标签更新负责持久化。AI 不能绕过颜色校验。
AI 不能绕过改名校验,也不能写入用户没有权限编辑的条目。AI 错误会说明失败边界,用户可以更换配置或重试。
文本工作台(TextWorkbench)让操作可重复
文本工作台(TextWorkbench)使用命名规则。规则列表保持小而明确。“转为大写【Uppercase】”和“转为小写【Lowercase】”修改字母大小写。
“首字母大写【Capitalize】”调整词首。“去除两侧空白【Trim】”清理边界。“合并空格【Collapse】”减少重复空格。 “移除空白行”删除空行。
“移除换行”合并为单行。“行排序【Sort lines】”重新排列行。“行反转【Reverse lines】”反转顺序。 “行去重【Deduplicate lines】”删除重复行。
“格式化 JSON”增加结构化缩进,“压缩 JSON”删除格式空白。“网址编码”对网址值编码,“网址解码”读取编码后的网址。
Base64 编码生成 Base64,Base64 解码读取 Base64。每条规则都有明确输入和输出。
每条规则都可以返回明确失败原因。
保存前先显示本地预览
桌面端可以先计算预览。源内容和输出同时可见,用户可以取消。
后端收到最终请求并再次检查规则。它拒绝不支持的输入和不完整的输入。
它拒绝过大输入、无效编码和空输出。校验失败时不会保存结果。
原始条目保持不变。
保存会创建新的快照
编辑不会修改旧历史记录。操作会创建输出文本、新的历史记录快照,并发送历史事件。
读取视图会刷新,搜索会收到新的索引任务。用户可以比较源内容和输出,也可以给新快照加标签。
用户可以把新快照发给其他设备。原始内容仍可用于审计。
真实流程:翻译截图
截取一张外语通知。打开图片预览,选择 OCR,等待文字和边界框。
检查提取结果,打开翻译,选择源内容语言和目标语言。
运行配置,对照源内容和翻译,复制翻译文字,需要时保存新的快照。
保留图片作为视觉参考,OCR 帮助翻译,翻译不会替换图片。
真实流程:整理 API 响应
复制一段 JSON 响应。打开文本工作台(TextWorkbench),选择 JSON 格式化并检查本地输出。
需要时选择行操作,把结果复制到工单;值得保留时保存新的快照,同时保留原始响应用于比较。
给结果加项目名称,稍后搜索项目。
真实流程:编辑 SVG 源内容
从设计工具复制 SVG 源内容。打开图形预览,切换到源内容,确认源内容标记。
打开文本工作台(TextWorkbench),执行“去除两侧空白【Trim】”或“合并空格【Collapse】”,检查输出并保存新的快照。
再次打开图形视图。源内容操作修改文字,渲染器仍然使用图形家族。
真实流程:AI 标签建议
复制研究笔记。打开标签编辑器,请求 AI 建议并逐条检查建议。
删除宽泛或错误的术语,选择持久化颜色,保存选中的标签,稍后搜索这些标签。
AI 不会保存隐藏关系,最终更新保持可见。
有助于恢复的错误状态
“不可用”表示当前状态无法运行功能;“不支持”表示输入家族没有对应操作;“过大”表示输入超过限制;“不完整”表示数据载荷仍在等待中。
“编码无效”表示源内容无法安全解码;“输出为空”表示规则没有产生内容。 “服务提供方超时”表示外部服务没有及时返回;“额度已用尽”表示账号策略阻止请求。
界面应该显示下一步动作,例如下载内容、更换配置或减少输入。修复编码问题后再重试,避免把同一份损坏输入反复送入服务。
OCR 排查
OCR 没有返回文字
检查源图片、图片尺寸、语言提示和服务提供方配置。
检查图片大小限制。源内容图形可以尝试渲染 PNG,保留原图用于比较。
框位置不对
检查图片是否经过缩放、坐标版本和渲染器输出尺寸。结果应该映射回原图坐标。
PDF OCR 很快停止
检查页面上限。当前默认处理两页;检查 32 MiB PDF 上限,必要时使用更小的 PDF 或提取相关页面。
翻译排查
翻译已禁用
检查翻译能力、源文本是否完整、选中的文件条目和服务提供方配置。
检查目标语言。
翻译返回了错误文件
打开集合,选择文件条目,确认出现位置和内容预览。
再次运行翻译。文件名不能作为稳定身份。
文本工作台(TextWorkbench)排查
编辑器没有打开
检查编辑能力、本地化状态和源内容家族。二进制图片需要 OCR,不是文字编辑。
二进制 Figma 文件需要视觉编辑器。
保存返回空输出
检查选择的规则和输入空白,选择另一条规则。后端会拒绝空快照。
输出替换了原始内容
预期行为是创建新的快照。刷新历史记录,比较源内容和输出;报告状态不一致时附带两个条目标识。
常见问题
OCR 需要云服务吗?
可用服务提供方取决于配置。历史记录条目仍然在本地,服务提供方产生的流量遵守配置的 OCR 边界。
文本工作台(TextWorkbench)会编辑截图吗?
它编辑文字源内容。先用 OCR 把截图变成文字。截图保持不变。
可以翻译 PDF 排版吗?
翻译处理提取后的源文本,PDF 预览保留原始排版。
AI 自动加标签会立即保存吗?
AI 返回建议,用户确认最终标签。
保存的编辑可以撤销吗?
原始历史记录条目会保留,需要源内容时重新选择它。
为什么拒绝空输出?
空快照无法说明是规则还是输入出了问题,显式错误可以保持历史记录干净。
可以同时运行多个翻译配置吗?
工作流允许时可以并行运行,每个结果保留源内容和目标设置。
二进制 Figma 可以进入文本工作台(TextWorkbench)吗?
它没有源文本表现。需要文本操作时使用 Figma 剪贴板源内容。
OCR 会改变搜索结果吗?
OCR 会向索引增加可搜索文字,不会改变原始视觉条目。
规则会随界面语言改变吗?
规则编号保持稳定,标签可以翻译。
验证清单
对截图运行 OCR。搜索提取出来的词。翻译结果。复制翻译。
对响应运行 JSON 格式化,保存新的快照,确认原始条目仍在,再编辑 SVG 源内容。
打开图形预览,请求 AI 标签建议,保存一个选中的标签,再重启桌面端。
确认快照和标签仍然存在。
选择工具前先看输入边界
遇到截图先确认图像已经完整到达,再决定运行 OCR。遇到 PDF 先看是否有文字层,避免为可以直接提取的页面重复渲染。遇到多文件集合, 先选定文件成员,避免把同名文件的结果保存到错误条目。遇到翻译和 AI,请先确认服务提供方、语言和输入范围,再发送内容。
这些检查并不增加流程负担,反而能减少返工。每个工具都会返回结构化结果,原始条目保持不变,失败也会留下可理解的状态。你可以从结果继续下一步, 也可以直接回到源内容重新选择规则。
快照让修改可追溯
文本操作、翻译和 AI 建议都可能改变文字。把结果保存为新的快照,意味着你能比较输入和输出,标记谁在什么时候确认了结果,也能在需要时删除派生内容而保留源图片。 快照不是隐藏的覆盖写入,而是一条可以搜索、加标签、同步和回收的普通历史记录。
当你只想临时复制结果时,不必保存快照;当结果要进入工单、报告或项目资料时,保存快照更稳妥。这个选择权属于你,工具只负责把边界显示清楚。
结果质量的最后检查
OCR 要核对数字、标点和换行;翻译要对照源文本和目标语言;格式化要检查结构是否仍然有效;AI 建议要确认标签和内容范围。任何一个输出都不应自动取代原文。 当输出看起来异常时,回到原始条目,换一个服务提供方或缩小输入,再重新运行。你最终保存的是经过确认的工作结果,而不是一次不可解释的自动改写。
交付前的最小检查
准备交付文字时,先确认快照来自正确的源条目,目标语言与读者一致,规则没有意外删除换行或标点。准备交付图片中的文字时,保留原图链接, 让收件人能够回到视觉上下文。准备交付 AI 生成的标签时,检查标签颜色和名称已经持久化,并确认没有把建议误当成最终分类。
如果输出来自外部服务,记录服务提供方和执行时间;如果输出只在本地完成,说明这一点可以帮助团队理解为什么另一台设备还没有看到相同快照。对于敏感材料, 优先复制经过确认的文字片段,避免把整张图片或完整原文发送给不需要它的人。
保持原始证据
原始条目是最可靠的回退点。OCR 失败时回到图片,翻译不准确时回到源文本,格式化破坏结构时回到原始 JSON,AI 建议不合适时删除派生快照即可。 把每一次转换都保存为新的、可命名的结果,工作台就能同时支持探索、复核和交付,而不会把一次试验变成不可逆的覆盖操作。
派生结果也要有清楚的所有者
OCR、翻译、格式化和人工智能建议都会产生新的文字。结果应该记录来源条目、执行工具、语言或规则、创建时间和当前状态,用户才能判断这段文字能否交付。一个翻译快照可以进入工单,OCR 快照可以进入搜索,人工智能建议可以停留在待确认状态;它们都不应该悄悄覆盖原始图片或原始文本。
原始条目
│ 只读参考
├─ 文字识别(OCR) → 识别快照 → 搜索 / 复制
├─ 翻译 → 翻译快照 → 对照 / 交付
├─ 文本规则 → 清理快照 → 编辑 / 导出
└─ 人工智能建议 → 待确认结果 → 选择后保存
保存快照前,界面先显示输入范围和输出预览;后端再次检查内容是否完整、规则是否支持、输出是否为空。检查通过后,系统写入新历史记录并提交索引任务,原始条目继续保留。检查失败时,系统只返回可理解的原因,不留下半截快照。用户因此可以反复试验,也可以在任何一步回到可靠的源内容。
| 输出类型 | 必须记录 | 用户确认点 |
|---|---|---|
| OCR | 图片、语言、引擎、坐标版本 | 数字、标点和框位置 |
| 翻译 | 源语言、目标语言、服务提供方 | 术语、格式和上下文 |
| 文本规则 | 规则名称、输入编码、输出长度 | 换行、缩进和结构 |
| 人工智能建议 | 服务提供方、输入范围、模型 | 标签、命名和隐私范围 |
当结果需要跨设备使用时,先同步元数据和快照状态,再按设备策略传输正文。接收端可以知道“这是一份已经确认的翻译”或“这是一份等待确认的建议”,但不能把待确认状态显示成最终答案。这个状态差异让协作、审计和删除都拥有清楚的范围。
继续阅读
阅读剪贴板内容类型,了解不同数据为何拥有不同能力。阅读OCR 和搜索,了解识别结果如何进入索引。阅读标签和回收站,了解如何管理派生结果的生命周期。当原文保持可见、每个输出都有明确所有者,文本工具才更可靠。