支持的文件格式
VizChat 文档解析器能识别哪些格式,它们走哪条解析路径,以及导出支持的格式。
VizChat 的文档解析器按三条路径分发文件:direct(纯文本直存)、local(本地库解析)、ocr(远程 OCR)。这决定了上传文件的速度和积分消耗。路径由 app/core/file_types.py 的 FILE_TYPE_REGISTRY 控制。
上传(import)支持矩阵
Direct — 纯文本,零成本,秒传
直接作为文本存储,不消耗积分,不经过解析器。适合代码、配置、轻量结构化数据。
| 类别 | 扩展名 |
|---|---|
| 纯文本 | .txt、.md、.mdx、.log |
| 表格(纯文本) | .csv、.tsv |
| 数据交换 | .json、.xml、.yaml / .yml、.toml、.ini、.cfg、.conf、.env |
| 网页 | .html、.htm |
| 代码 | .py、.js、.ts、.tsx、.jsx、.java、.go、.c、.cpp、.h、.hpp、.rs、.sql、.sh、.bash、.zsh、.rb、.php、.swift、.kt、.scala、.r、.R、.css、.scss、.less |
Local — 本地 Python 库解析,低成本
由后端 Python 解析库(如 python-docx、openpyxl、python-pptx)处理。不消耗 OCR 积分,但会占用处理时间。
| 扩展名 | 说明 |
|---|---|
.docx | Word 文档(新版) |
.pptx | PowerPoint(新版) |
.xlsx | Excel(新版) |
.doc | Word 旧版 |
.xls | Excel 旧版 |
OCR — 远程 OCR API,按页计费
使用 GLM-OCR 或 PaddleOCR-VL 处理扫描件 / 图片 / PDF,按页消耗积分(详见 套餐对照)。
| 类别 | 扩展名 |
|---|---|
| 文档 | .pdf |
原样存储 —— 图片与音视频
图片(.jpg / .jpeg、.png、.gif、.bmp、.webp、.svg、.ico、.heic)与音视频文件上传后按原文件保存,不做解析,也不消耗积分。
已知缺口
.ppt(PowerPoint 旧版二进制)不在可识别的文档格式内。上传它当前不会被拒绝,而是被当成纯文本存下、内容不可读——请先另存为 .pptx 再上传。
如果文件扩展名缺失,解析器会回退到 MIME 类型判断(见 MIME_TO_EXT 映射)。
导出(export)格式
| 产物 | 支持格式 |
|---|---|
| 故事板 | .vizpkg —— 便携归档,含画板本身及其引用的每个文件 |
| 文档 | 按原文件名下载原始文件,字节原样返回 |
| 聊天会话 | .json —— 全部会话,入口在 设置 → 数据管理 |
| 图片 / PDF / 视频 | 暂不支持 —— 见 导出概览 |