腾讯优图开源全模态解析模型 Youtu-Parsing-Omni 统一处理文档音视频
10 月 9 日前后,腾讯优图实验室在 Hugging Face 与 GitHub 同步开源了全模态解析模型 Youtu-Parsing-Omni,并放出模型权重、vLLM 插件与推理示例。这是腾讯在文档与多模态理解方向的一次集中开源,模型卡显示其参数量约 53 亿(BF16),上下文长度达到 104 万 token,单张中端显卡即可在量化后运行。

与传统 OCR 只识别字符不同,Youtu-Parsing-Omni 用单一编码器统一处理文档页、自然图像、图表、流程图、几何图形、音频以及带音轨的视频,再根据任务提示输出同一套结构化 JSON 信封。它既包含版面、文本、表格、公式、坐标、时间戳、语音识别等感知字段,也包含标题、叙述、报告等认知字段,坐标采用 0 到 1000 的相对网格编码。开发者通过 document、natural_image、graphics_chart、audio、natural_video 等任务键切换输出类型,而不必为每种媒体单独训练识别器。
在公开评测中,该模型表现突出:在 OmniDocBench v1.6 上取得 96.96 的综合得分,处于对比模型首位;在覆盖自然图像、图形、音频与视频的 OmniParsingBench 上以 75.08 的平均分成为最佳开源权重模型,仅次于 Gemini-3-Pro。它在图表解析与音频理解上甚至超过 Gemini-3-Pro,并在化学结构式(ChemOCR)与乐谱(PDMX)等小众任务上与专用模型表现相当。

对应用侧而言,这类“一个模型解析一切”的能力意味着企业可以把扫描件、票据、会议录音、监控视频等非结构化证据直接转成可检索、可校验的数据。例如在财报页面抽取表格与标题并核对数值,或为视频档案生成带时间戳的语音与事件描述,从而支撑文档工作流、媒体检索与无障碍服务。官方评测代码目前仍标注为待发布,技术报告 arXiv 号也暂为占位。
Youtu-Parsing-Omni 延续了腾讯优图早前的 Youtu-VL 与 Youtu-LLM 路线,是其在多模态解析赛道的重要落子。值得注意的是,模型采用自定义的“youtu-parsing”许可证而非 Apache、MIT 等标准开源协议,加载需信任远程代码,企业在商用前仍需仔细核对授权条款。在 OCR 之后,文档与音视频的结构化解析正成为大模型落地的高频刚需。
读者评论 (0)
想参与讨论?请 登录 后发表评论。
还没有评论,欢迎抢沙发!