OpenRouter 入门与概览

OpenRouter 入门与概览

多模态概览

1 分钟阅读

多模态能力

向 OpenRouter 模型发送图像、PDF、音频和视频,将文本合成为语音,或将音频转写为文本

OpenRouter 通过统一 API 支持文本之外的多种输入和输出模态,让你可以向兼容模型发送图像、PDF、音频和视频文件,或将文本合成为语音。这为丰富的多模态交互覆盖了广泛的使用场景。

支持的模态

图像

向具备视觉能力的模型发送图像,用于分析、描述、光学字符识别(OCR)等。OpenRouter 支持多种图像格式,以及基于 URL 和 Base64 编码的图像。

了解图像输入 →

图像生成

使用具备图像输出能力的 AI 模型,根据文本提示词生成图像。OpenRouter 支持多种图像生成模型,可根据你的描述创建高质量图像。

了解图像生成 →

PDF

使用 OpenRouter 上的任意模型处理 PDF 文档。我们的智能 PDF 解析系统会提取文本,并同时处理基于文本的文档和扫描件。

了解 PDF 处理 →

音频

向具备语音能力的模型发送音频文件,用于转写、分析和处理;也可从具备音频输出能力的模型接收音频响应。OpenRouter 的输入和输出均支持常见音频格式。

了解音频 →

视频

向具备视频能力的模型发送视频文件,用于分析、描述、物体检测和动作识别。OpenRouter 支持多种视频格式,可完成全面的视频理解任务。

了解视频输入 →

视频生成

使用具备视频输出能力的 AI 模型,根据文本提示词生成视频。OpenRouter 支持异步视频生成 API,可配置分辨率、宽高比、时长,以及可选的参考图。

了解视频生成 →

文字转语音(TTS)

使用兼容 OpenAI 的专用端点,将文本合成为语音音频。OpenRouter 支持多家 TTS 模型服务提供商和多种音色,输出为 MP3 或 PCM 格式。

了解文字转语音 →

语音转文字(STT)

使用专用端点将音频转写为文本。OpenRouter 支持多家 STT 模型服务提供商和多种模型,返回包含转写文本和用量统计的结构化 JSON。

了解语音转文字 →

入门

大多数多模态输入使用同一个 /api/v1/chat/completions 端点,并通过 messages 参数传递。不同内容类型在消息的 content 数组中指定:

  • 图像:使用 image_url 内容类型
  • PDF:使用带有 PDF 数据的 file 内容类型
  • 音频:使用 input_audio 内容类型
  • 视频:使用 video_url 内容类型

你可以在单次请求中组合多种模态;可发送的文件数量因模型服务提供商和模型而异。

TTS 使用独立的专用端点 /api/v1/audio/speech。详见 TTS 文档

STT 使用独立的专用端点 /api/v1/audio/transcriptions。详见 STT 文档

模型兼容性

并非所有模型都支持每一种模态。OpenRouter 会根据请求内容自动筛选可用模型:

  • 视觉模型:处理图像时需要
  • 兼容文件的模型:可原生处理 PDF,或通过我们的解析系统处理
  • 具备音频能力的模型:处理音频输入时需要
  • 具备视频能力的模型:处理视频输入时需要

请使用我们的模型页面查找支持所需输入模态的模型。

输入格式支持

OpenRouter 的多模态输入同时支持直接 URLBase64 编码数据

URL(推荐用于公开内容)

  • 图像https://example.com/image.jpg
  • PDFhttps://example.com/document.pdf
  • 音频:不支持通过 URL(仅支持 Base64)
  • 视频:因模型服务提供商而异(例如 AI Studio 上的 Gemini 支持 YouTube 链接)

Base64 编码(本地文件必须使用)

  • 图像data:image/jpeg;base64,{base64_data}
  • PDFdata:application/pdf;base64,{base64_data}
  • 音频:带格式说明的原始 Base64 字符串
  • 视频data:video/mp4;base64,{base64_data}

对于大文件,URL 更高效,因为无需在本地编码,也能减小请求载荷体积。本地文件或内容无法公开访问时,必须使用 Base64 编码。

关于视频 URL 的说明:视频 URL 支持因模型服务提供商而异。例如,AI Studio 上的 Google Gemini 仅支持 YouTube 链接。各模型服务提供商的具体说明见视频输入文档

常见问题

可以!你可以在同一次请求中发送文本、图像、PDF、音频和视频。模型会一并处理所有输入。

  • 图像:通常按图像计费,或按输入 Token 计费
  • PDF:文本提取免费,OCR 处理收费,或按模型原生定价
  • 音频输入:按时长折算为输入 Token 计费
  • 音频输出:按补全 Token 计费
  • 视频:按时长和分辨率折算为输入 Token 计费

视频支持因模型而异。请使用模型页面筛选具备视频能力的模型。请查阅各模型文档,了解具体的视频格式和时长限制。

视频生成使用位于 /api/v1/videos 的异步 API。你提交提示词后会收到任务 ID,然后轮询直到视频就绪并可以下载。详见视频生成文档

TTS 使用专用端点 /api/v1/audio/speech。发送文本后会收到原始音频字节流。该端点兼容 OpenAI Audio Speech API,因此可以使用 OpenAI 客户端库。详见 TTS 文档

STT 使用专用端点 /api/v1/audio/transcriptions。发送 Base64 编码的音频后,会收到包含转写文本和用量统计的 JSON 响应。详见 STT 文档