arXiv 论文翻译工具 - 将英文 LaTeX 论文翻译成中文,保留数学公式和文档结构
Project description
ieeA - arXiv 论文翻译工具
将英文 arXiv 论文翻译成中文,保留数学公式、引用和文档结构。
快速开始
# 安装
pip install -e .
# 翻译 arXiv 论文
ieeA translate https://arxiv.org/abs/2301.07041 --output-dir output/
高级选项
批量翻译优化
- 短内容(< 100 字符)会自动批量翻译,减少 API 调用
- 纯占位符内容(如作者信息)会自动跳过翻译
翻译流程 (Pipeline)
┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐
│ 1. 下载 │ -> │ 2. 解析 │ -> │ 3. 翻译 │ -> │ 4. 重组 │ -> │ 5. 编译 │
│ arXiv源码 │ │ LaTeX结构 │ │ 文本块 │ │ LaTeX文档 │ │ 生成PDF │
└─────────────┘ └─────────────┘ └─────────────┘ └─────────────┘ └─────────────┘
1. 下载 (Downloader)
从 arXiv 下载论文源码压缩包,自动解压并定位主 .tex 文件。
2. 解析 (Parser)
将 LaTeX 文档解析为可翻译的文本块 (Chunk),同时保护不应翻译的元素。
Chunk 划分依据(实际规则)
| 类型 | 处理方式 | 方法 | 示例 |
|---|---|---|---|
| 作者块 | 保护为占位符,不翻译 | 正则 + 大括号计数 | \author{...} → [[AUTHOR_n]] |
| caption | 提取为 Chunk | 正则 + 大括号计数 | \caption{...} → {{CHUNK_uuid}} |
| 保护环境 | 保护为占位符 | 正则 + 环境嵌套计数 | equation, align, tikzpicture → [[MATHENV_n]] |
| 行内数学 | 保护为占位符 | 手写扫描 | $...$, \(...\), \[...\] → [[MATH_n]] |
| 保护命令 | 保护为占位符 | 正则 + 大括号计数 | \cite{}, \ref{}, \label{}, \url{}, \footnote{} |
| 结构命令 | 提取参数为 Chunk | 正则 + 大括号计数 | \title{}, \section{} |
| 可翻译环境 | 环境内容提取为 Chunk | 正则 + 环境嵌套计数 | abstract, itemize, enumerate |
| 段落文本 | 按空行分段,长度>20字符提取为 Chunk | 行级扫描 + 阈值 | 正文段落 |
处理顺序(源码顺序)
原文 -> 保护作者块 -> 提取caption -> 保护数学环境 -> 保护行内公式
-> 保护命令(\cite等) -> 提取结构命令 -> 提取可翻译环境 -> 分割段落 -> Chunks
3. 翻译 (Translator)
- 并发调用 LLM API 翻译各 Chunk
- 支持术语表 (Glossary) 保持术语一致性
- 自动重试和断点续传
4. 重组 (Reconstructor)
将翻译后的文本替换回占位符位置,还原完整 LaTeX 文档。
5. 编译 (Compiler)
使用 XeLaTeX 编译生成中文 PDF,自动注入中文字体支持。
配置
配置文件位置:~/.ieeA/config.yaml
完整配置模板(按需删减,留空表示使用默认值):
llm:
# SDK: openai | openai-coding | anthropic | null(null 表示直连 HTTP)
sdk: null
# 模型名或列表(列表时取第一个)
models: openai/gpt-5-mini
# API Key(当 sdk 非空时必填)
key: ""
# 可选:自定义接口地址
endpoint: https://openrouter.ai/api/v1/chat/completions
temperature: 0.1
max_tokens: 4000
compilation:
engine: xelatex
timeout: 120
clean_aux: true
paths:
output_dir: output
cache_dir: .cache
fonts:
# 自动检测中文字体
auto_detect: true
# 手动指定字体(可选)
main: null
sans: null
mono: null
translation:
# 自定义提示词(可选)
custom_system_prompt: null
custom_user_prompt: null
# 额外保留原文的术语列表(不翻译)
preserve_terms: []
# 翻译质量:standard 或 high
quality_mode: standard
# Few-shot 示例文件路径(可选)
examples_path: null
parser:
# 额外保护的 LaTeX 环境(不翻译)
extra_protected_environments: []
# 额外可翻译的 LaTeX 环境
extra_translatable_environments: []
迭代发送模式 (openai-coding)
将 llm.sdk 设为 openai-coding 即可启用迭代发送模式。该模式下,翻译请求按顺序逐条发送,每次请求携带之前所有请求的完整对话历史,利用 LLM 提供商的 KV cache 前缀匹配来降低延迟和成本。
# ~/.ieeA/config.yaml
llm:
sdk: openai-coding
models: gpt-4o
key: "sk-xxx"
endpoint: https://api.openai.com/v1/chat/completions # 接口仍为标准 v1/chat/completions
也可通过命令行参数指定:
ieeA translate https://arxiv.org/abs/2301.07041 --sdk openai-coding
与默认模式的区别:
默认模式 (openai) |
迭代模式 (openai-coding) |
|
|---|---|---|
| 并发 | 多请求并发 | 严格顺序,逐条发送 |
| 上下文 | 每个 chunk 独立翻译 | 携带全部历史对话,术语用词自动保持一致 |
| 术语表 | 按 chunk 内容过滤后发送 | 发送完整术语表(保证 system prompt 不变以命中缓存) |
| 系统提示词 | 标准提示词 | 额外追加"保持专业名词一致性"指令 |
| Few-shot | 注入 | 始终注入,且位置固定 |
| 断点续传 | 支持 | 支持(对话历史随 state file 一同保存) |
适用场景: 使用支持 KV cache 前缀匹配的提供商(如 OpenAI、DeepSeek)时,推荐使用此模式以获得更好的术语一致性和更低的推理成本。
术语表
术语表位置:~/.ieeA/glossary.yaml
# 保持原文不翻译
"MMLU": "MMLU"
"LLaMA": "LLaMA"
# 指定翻译
"Attention": "注意力机制"
"Transformer":
target: "Transformer"
context: "Deep Learning"
支持的 LLM
| 提供商 | 模型示例 | 环境变量 |
|---|---|---|
| OpenAI | gpt-4o, gpt-4o-mini | OPENAI_API_KEY |
| Claude | claude-3-opus, claude-3-sonnet | ANTHROPIC_API_KEY |
| Qwen | qwen-turbo, qwen-max | DASHSCOPE_API_KEY |
| Doubao | doubao-pro-* | VOLCENGINE_API_KEY |
提示:可通过 base_url 配置使用 OpenRouter 等代理服务。
项目结构
src/ieeA/
├── cli.py # 命令行入口
├── downloader/ # arXiv 下载器
├── parser/ # LaTeX 解析与分块
│ ├── latex_parser.py # 核心解析逻辑
│ └── structure.py # Chunk 数据结构
├── translator/ # 翻译流水线
├── compiler/ # PDF 编译
├── validator/ # 翻译质量验证
└── rules/ # 配置与术语表
依赖
- Python 3.10+
- XeLaTeX(用于 PDF 编译)
- 中文字体(macOS 自动检测 Songti SC / PingFang SC)
License
GPL-3.0
Project details
Release history Release notifications | RSS feed
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file ieea-1.2.0.post0.tar.gz.
File metadata
- Download URL: ieea-1.2.0.post0.tar.gz
- Upload date:
- Size: 50.1 MB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.2.0 CPython/3.12.2
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
b33561efe2fb929f5a06ce5eaed72acf4ab7fb0223777486d61a00180c0e4155
|
|
| MD5 |
0a5f71976f71cb102b89a87f802fbf3b
|
|
| BLAKE2b-256 |
5ad72ffca0b3e8a54bedbbd9f43b06712466896995b4336b0ef92e2f8d3ca068
|
File details
Details for the file ieea-1.2.0.post0-py3-none-any.whl.
File metadata
- Download URL: ieea-1.2.0.post0-py3-none-any.whl
- Upload date:
- Size: 65.3 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.2.0 CPython/3.12.2
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
c4eaf8c34b655c0198122d2e1c7752734e38d84005f073d9e31fe04909978a30
|
|
| MD5 |
9534fd0d46447ac7faeac8616616be52
|
|
| BLAKE2b-256 |
a9e02f7d0f8c85bcd183bb02116d41bc2526686d946e62e8c751e2857fc5b6e1
|