OpenRouter 入门与概览
OpenRouter 入门与概览
多模态概览
1 分钟阅读
多模态能力
向 OpenRouter 模型发送图像、PDF、音频和视频,将文本合成为语音,或将音频转写为文本
OpenRouter 通过统一 API 支持文本之外的多种输入和输出模态,让你可以向兼容模型发送图像、PDF、音频和视频文件,或将文本合成为语音。这为丰富的多模态交互覆盖了广泛的使用场景。
支持的模态
图像
向具备视觉能力的模型发送图像,用于分析、描述、光学字符识别(OCR)等。OpenRouter 支持多种图像格式,以及基于 URL 和 Base64 编码的图像。
图像生成
使用具备图像输出能力的 AI 模型,根据文本提示词生成图像。OpenRouter 支持多种图像生成模型,可根据你的描述创建高质量图像。
使用 OpenRouter 上的任意模型处理 PDF 文档。我们的智能 PDF 解析系统会提取文本,并同时处理基于文本的文档和扫描件。
音频
向具备语音能力的模型发送音频文件,用于转写、分析和处理;也可从具备音频输出能力的模型接收音频响应。OpenRouter 的输入和输出均支持常见音频格式。
视频
向具备视频能力的模型发送视频文件,用于分析、描述、物体检测和动作识别。OpenRouter 支持多种视频格式,可完成全面的视频理解任务。
视频生成
使用具备视频输出能力的 AI 模型,根据文本提示词生成视频。OpenRouter 支持异步视频生成 API,可配置分辨率、宽高比、时长,以及可选的参考图。
文字转语音(TTS)
使用兼容 OpenAI 的专用端点,将文本合成为语音音频。OpenRouter 支持多家 TTS 模型服务提供商和多种音色,输出为 MP3 或 PCM 格式。
语音转文字(STT)
使用专用端点将音频转写为文本。OpenRouter 支持多家 STT 模型服务提供商和多种模型,返回包含转写文本和用量统计的结构化 JSON。
入门
大多数多模态输入使用同一个 /api/v1/chat/completions 端点,并通过 messages 参数传递。不同内容类型在消息的 content 数组中指定:
- 图像:使用
image_url内容类型 - PDF:使用带有 PDF 数据的
file内容类型 - 音频:使用
input_audio内容类型 - 视频:使用
video_url内容类型
你可以在单次请求中组合多种模态;可发送的文件数量因模型服务提供商和模型而异。
TTS 使用独立的专用端点 /api/v1/audio/speech。详见 TTS 文档。
STT 使用独立的专用端点 /api/v1/audio/transcriptions。详见 STT 文档。
模型兼容性
并非所有模型都支持每一种模态。OpenRouter 会根据请求内容自动筛选可用模型:
- 视觉模型:处理图像时需要
- 兼容文件的模型:可原生处理 PDF,或通过我们的解析系统处理
- 具备音频能力的模型:处理音频输入时需要
- 具备视频能力的模型:处理视频输入时需要
请使用我们的模型页面查找支持所需输入模态的模型。
输入格式支持
OpenRouter 的多模态输入同时支持直接 URL 和 Base64 编码数据:
URL(推荐用于公开内容)
- 图像:
https://example.com/image.jpg - PDF:
https://example.com/document.pdf - 音频:不支持通过 URL(仅支持 Base64)
- 视频:因模型服务提供商而异(例如 AI Studio 上的 Gemini 支持 YouTube 链接)
Base64 编码(本地文件必须使用)
- 图像:
data:image/jpeg;base64,{base64_data} - PDF:
data:application/pdf;base64,{base64_data} - 音频:带格式说明的原始 Base64 字符串
- 视频:
data:video/mp4;base64,{base64_data}
对于大文件,URL 更高效,因为无需在本地编码,也能减小请求载荷体积。本地文件或内容无法公开访问时,必须使用 Base64 编码。
关于视频 URL 的说明:视频 URL 支持因模型服务提供商而异。例如,AI Studio 上的 Google Gemini 仅支持 YouTube 链接。各模型服务提供商的具体说明见视频输入文档。
常见问题
可以在一次请求中混合不同模态吗?
可以在一次请求中混合不同模态吗?
可以!你可以在同一次请求中发送文本、图像、PDF、音频和视频。模型会一并处理所有输入。
多模态内容如何计费?
多模态内容如何计费?
- 图像:通常按图像计费,或按输入 Token 计费
- PDF:文本提取免费,OCR 处理收费,或按模型原生定价
- 音频输入:按时长折算为输入 Token 计费
- 音频输出:按补全 Token 计费
- 视频:按时长和分辨率折算为输入 Token 计费
哪些模型支持视频输入?
哪些模型支持视频输入?
视频支持因模型而异。请使用模型页面筛选具备视频能力的模型。请查阅各模型文档,了解具体的视频格式和时长限制。
视频生成如何工作?
视频生成如何工作?
视频生成使用位于 /api/v1/videos 的异步 API。你提交提示词后会收到任务 ID,然后轮询直到视频就绪并可以下载。详见视频生成文档。
TTS 如何工作?
TTS 如何工作?
TTS 使用专用端点 /api/v1/audio/speech。发送文本后会收到原始音频字节流。该端点兼容 OpenAI Audio Speech API,因此可以使用 OpenAI 客户端库。详见 TTS 文档。
STT 如何工作?
STT 如何工作?
STT 使用专用端点 /api/v1/audio/transcriptions。发送 Base64 编码的音频后,会收到包含转写文本和用量统计的 JSON 响应。详见 STT 文档。