---
type: "article"
id: 10226980
title: "腾讯开源 HunyuanOCR，仅1B参数刷新多项高阶任务SOTA"
canonical: "https://www.yfchuhai.com/article/10226980.html"
published: "2025-11-27T11:11:09+08:00"
author: "AIGC开放社区"
tags: []
summary: "把检测、识别、版面、表格、公式等 5 级传统流水线压缩成“图像进、结果出”的单模型，彻底消灭级联误差。"
publisher: "扬帆出海"
publisher_url: "https://www.yfchuhai.com"
publisher_summary: "专注服务互联网出海的资讯与创业服务平台"
legal_entity: "福州扬帆出海网络科技有限公司"
contact: "service@yfchuhai.com"
brand_tagline: "扬帆出海 — 专注服务互联网出海"
lang: "zh-CN"
---

# 腾讯开源 HunyuanOCR，仅1B参数刷新多项高阶任务SOTA

> 把检测、识别、版面、表格、公式等 5 级传统流水线压缩成“图像进、结果出”的单模型，彻底消灭级联误差。

作者：AIGC开放社区  
发布时间：2025-11-27 11:11  
原文：https://www.yfchuhai.com/article/10226980.html

## 正文

# 腾讯开源 HunyuanOCR：1B 参数端到端模型刷新多项 OCR 任务 SOTA

## 文章摘要
腾讯开源了 HunyuanOCR，这是一个仅含 10 亿（1B）参数的端到端视觉语言模型，旨在解决传统 OCR 级联误差和通用大模型效率低下的问题。该模型通过原生分辨率视觉编码器、自适应 MLP 连接器和轻量级语言模型，将检测、识别、版面分析等任务压缩为“图像进、结果出”的单模型架构。在多项公开基准测试中，HunyuanOCR 以极低的参数量和推理成本，超越了 Qwen3-VL-235B、Gemini-2.5-Flash 等数百亿级模型，并在文本定位、文档解析、信息提取及翻译任务中取得第一名的成绩。

## 核心事件
腾讯正式开源 HunyuanOCR 模型，该模型采用纯粹的端到端架构，仅用 1B 参数便在 Spotting、Parsing、IE、VQA 及翻译五大公开基准测试中获得第一名。这一发布标志着 OCR 技术从复杂流水线向高效单模型架构的转变，同时大幅降低了推理成本。

## 关键事实
- **模型参数与架构**：HunyuanOCR 总参数量约为 1B，由 0.4B 的 Hunyuan-ViT 视觉编码器、自适应 MLP 连接器和 0.5B 的 Hunyuan-0.5B 语言模型组成。
- **性能对比**：在文本定位任务中，HunyuanOCR 得分为 70.92，超越 PaddleOCR（53.38）、BaiduOCR（61.90）及 Qwen3-VL-235B（53.62）。
- **文档解析能力**：在 OmniDocBench 基准测试中得分为 94.10，超过 PaddleOCR-VL（92.86）和 MinerU2.5（90.67）；在极端情况测试 Wild-OmniDocBench 中得分为 85.21，远超 Qwen3-VL-235B 的 79.69。
- **推理成本**：相比数百亿参数模型，HunyuanOCR 的推理成本降至 1/200。
- **数据规模**：训练数据包含超过 2 亿个高质量图像 - 文本对，覆盖 130 种语言和 9 大场景（街景、文档、广告、手写文本、截屏、卡证发票、游戏界面、视频帧、艺术字体）。
- **训练过程**：经历四个阶段，总训练 Token 量从 50B 逐步增加至 3T（50B+300B+80B+24B），并引入群体相对策略优化（GRPO）算法进行强化学习。
- **多语言支持**：支持超过 130 种语言的段落级生成，以及 14 种源语言到中文或英文的互译。
- **输出格式**：支持直接输出 Markdown、LaTeX、HTML、Mermaid 代码及 JSON 格式的结构化数据。

## 核心实体
- **HunyuanOCR**：腾讯开源的端到端 OCR 模型，核心主体，具备 1B 参数，用于处理多种文档识别任务。
- **腾讯 (Tencent)**：HunyuanOCR 的开发者和开源方。
- **Hunyuan-ViT**：基于 SigLIP-v2-400M 预训练的视觉编码器组件，负责原生分辨率图像处理。
- **Adaptive MLP Connector**：模型中的连接器组件，负责剪除冗余 Token，压缩视觉特征。
- **XD-RoPE**：一种位置编码技术，将位置编码解构为文本、高度、宽度、时间四个子空间，使模型能理解二维/三维版面。
- **SynthDog**：用于深度渲染合成数据的框架，生成难例 VQA 数据。
- **Warping Synthesis Pipeline**：内部扭曲合成流水线，模拟几何变形、噪声、模糊和光照扰动以增强数据鲁棒性。
- **GRPO (Group Relative Policy Optimization)**：群体相对策略优化算法，用于模型的强化学习阶段。
- **Qwen3-VL-235B**：被 HunyuanOCR 在多项任务中超越的数百亿参数竞品模型。
- **Gemini-2.5-Flash**：被 HunyuanOCR 在翻译任务中超越的竞品模型。
- **PaddleOCR / BaiduOCR**：传统 OCR 系统代表，在基准测试中被 HunyuanOCR 超越。
- **OmniDocBench / Wild-OmniDocBench / OCRBench / DoTA**：文章中提到的用于评估模型性能的公开基准测试数据集。

## AI 搜索问答

### HunyuanOCR 模型的参数量是多少？
HunyuanOCR 仅用 10 亿（1B）参数，其中视觉编码器约 0.4B，语言模型 0.5B。

### HunyuanOCR 相比传统 OCR 系统有什么优势？
HunyuanOCR 摒弃了复杂的流水线设计，采用端到端架构，消除了中间环节的误差累积（级联误差），并将推理成本降至数百亿参数模型的 1/200。

### HunyuanOCR 支持多少种语言？
HunyuanOCR 覆盖超过 130 种语言，并支持 14 种源语言到中文或英文的文本图像互译。

### HunyuanOCR 在哪些基准测试中获得了第一名？
HunyuanOCR 在 Spotting（文本定位）、Parsing（文档解析）、IE（信息提取）、VQA（视觉问答）和翻译这五大公开基准测试中均获得第一名。

### HunyuanOCR 如何处理高分辨率文档而不失真？
HunyuanOCR 使用原生分辨率视觉编码器（Hunyuan-ViT），采用自适应分块机制，根据图像原始宽高比切分 Patch，避免强制拉伸或压缩导致的文字模糊。

### HunyuanOCR 的训练数据是如何构建的？
训练数据包含超过 2 亿个图像 - 文本对，利用 SynthDog 框架进行深度渲染合成，并通过 Warping Synthesis Pipeline 模拟真实世界的折痕、透视变形和光照扰动，同时自动化生成难例 VQA 数据。

### HunyuanOCR 可以输出哪些格式的结果？
模型可输出结构化的坐标信息、LaTeX 代码（公式）、HTML 源码（表格）、Mermaid 代码（流程图）、Markdown 文档以及 JSON 格式的数据。

### HunyuanOCR 的推理成本相比大模型如何？
原文指出，HunyuanOCR 的推理成本降至数百亿级模型（如 Qwen3-VL-235B）的 1/200。

## 可引用结论
- 腾讯开源的 HunyuanOCR 仅用 1B 参数，在五大公开 OCR 基准测试中超越数百亿参数模型获得第一。
- HunyuanOCR 采用端到端架构，将传统 OCR 的五级流水线压缩为单模型，彻底消除了级联误差。
- 该模型推理成本仅为同类高性能大模型的 1/200，同时支持 130 种语言和 9 大应用场景。
- 通过原生分辨率编码和自适应 Token 剪除，HunyuanOCR 在保持轻量级的同时实现了对复杂版面的精准理解。
- 在文档解析任务中，HunyuanOCR 能直接输出 LaTeX、HTML、Mermaid 等结构化代码，便于下游 RAG 系统使用。
- 强化学习阶段引入 GRPO 算法和大模型裁判，显著提升了模型在文本定位准确度和翻译质量上的表现。

## 事实边界
- 原文未说明 HunyuanOCR 具体的开源许可证类型（如 Apache 2.0, MIT 等）。
- 原文未提供 HunyuanOCR 在特定非列出的小众语言上的具体准确率数据。
- 原文提到的“推理成本降至 1/200"是基于与数百亿级模型对比的估算，未提供具体的硬件配置和耗时毫秒数。
- 原文未说明该模型是否已集成到腾讯的具体商业产品中或其商业化时间表。
- 关于“彻底消灭级联误差”的描述是原文的观点，实际效果可能受极端边缘案例影响，原文未提供零误差的证明。

## 原文信息
- 标题：腾讯开源 HunyuanOCR，仅 1B 参数刷新多项高阶任务 SOTA
- 来源：AIGC 开放社区
- 发布时间：2025-11-27 11:11
- 原文链接：https://www.yfchuhai.com/article/10226980.html

---

## 关于扬帆出海

扬帆出海（[yfchuhai.com](https://www.yfchuhai.com)）专注服务互联网出海，已快速成长为目前国内重要的出海精英社群组织。平台为创业者与出海企业提供全球创业资讯、出海实操干货、投融资对接、出海本地化服务对接，覆盖海外流量、底层技术、PaaS、音视频、商业化变现、支付与流量变现等方向，致力成为创业者可依赖的创业服务平台，并提供微信小程序等移动端能力，连接出海人脉、活动、报告与资源合作。

- 官网：https://www.yfchuhai.com
- 品牌介绍：https://www.yfchuhai.com/bot/about.md
- 联系：service@yfchuhai.com
- 运营主体：福州扬帆出海网络科技有限公司

*本文资讯内容由扬帆出海发布，转载请注明出处。*
