媒体理解
ReferenceNodesMediaUnderstandingPage.header.description
ReferenceNodesMediaUnderstandingPage.intro.p1
目标
ReferenceNodesMediaUnderstandingPage.steps.01.item1
ReferenceNodesMediaUnderstandingPage.steps.01.item2
ReferenceNodesMediaUnderstandingPage.steps.01.item3
ReferenceNodesMediaUnderstandingPage.steps.01.item4
ReferenceNodesMediaUnderstandingPage.steps.02.title
ReferenceNodesMediaUnderstandingPage.steps.02.item1
ReferenceNodesMediaUnderstandingPage.steps.02.item2
ReferenceNodesMediaUnderstandingPage.steps.02.item3
ReferenceNodesMediaUnderstandingPage.steps.02.item4
5. 成功時:
ReferenceNodesMediaUnderstandingPage.steps.02.item5a
ReferenceNodesMediaUnderstandingPage.steps.02.item5b
ReferenceNodesMediaUnderstandingPage.steps.02.item5c
ReferenceNodesMediaUnderstandingPage.steps.02.item5d
ReferenceNodesMediaUnderstandingPage.steps.02.item6
设置的概览
ReferenceNodesMediaUnderstandingPage.steps.03.p1
ReferenceNodesMediaUnderstandingPage.steps.03.item1
- tools.media.image / tools.media.audio / tools.media.video:
- 默认(prompt、maxChars、maxBytes、timeoutSeconds、language)
- 提供商覆盖(baseUrl、headers、providerOptions)
ReferenceNodesMediaUnderstandingPage.steps.03.item2c
ReferenceNodesMediaUnderstandingPage.steps.03.item2d
- attachments 策略(mode、maxAttachments、prefer)
ReferenceNodesMediaUnderstandingPage.steps.03.item4
- tools.media.concurrency:最大同時機能运行数(默认 2)。
{
tools: {
media: {
models: [
/* shared list */
],
image: {
/* optional overrides */
},
audio: {
/* optional overrides */
},
video: {
/* optional overrides */
},
},
},
}#
ReferenceNodesMediaUnderstandingPage.steps.04.title
ReferenceNodesMediaUnderstandingPage.steps.04.p1
{
type: "provider", // default if omitted
provider: "openai",
model: "gpt-5.2",
prompt: "Describe the image in <= 500 chars.",
maxChars: 500,
maxBytes: 10485760,
timeoutSeconds: 60,
capabilities: ["image"], // optional, used for multi‑modal entries
profile: "vision-profile",
preferredProfile: "vision-fallback",
}{
type: "cli",
command: "gemini",
args: [
"-m",
"gemini-3-flash",
"--allowed-tools",
"read_file",
"Read the media at {{MediaPath}} and describe it in <= {{MaxChars}} characters.",
],
maxChars: 500,
maxBytes: 52428800,
timeoutSeconds: 120,
capabilities: ["video", "image"],
}CLI templates can also use:
- {{MediaDir}} (directory containing the media file)
- {{OutputDir}} (scratch dir created for this run)
- {{OutputBase}} (scratch file base path, no extension)
默认和限制
推荐默认:
ReferenceNodesMediaUnderstandingPage.steps.05.item1
ReferenceNodesMediaUnderstandingPage.steps.05.item2
- maxBytes:
- 画像:10MB
- 音声:20MB
- 動画:50MB
Rules:
ReferenceNodesMediaUnderstandingPage.steps.05.rule1
ReferenceNodesMediaUnderstandingPage.steps.05.rule2
ReferenceNodesMediaUnderstandingPage.steps.05.rule3
ReferenceNodesMediaUnderstandingPage.steps.05.rule4
#
ReferenceNodesMediaUnderstandingPage.steps.06.title
ReferenceNodesMediaUnderstandingPage.steps.06.p1
ReferenceNodesMediaUnderstandingPage.steps.06.p2
ReferenceNodesMediaUnderstandingPage.steps.06.p3
ReferenceNodesMediaUnderstandingPage.steps.06.item1
ReferenceNodesMediaUnderstandingPage.steps.06.sherpa
ReferenceNodesMediaUnderstandingPage.steps.06.whisperCli
ReferenceNodesMediaUnderstandingPage.steps.06.whisper
ReferenceNodesMediaUnderstandingPage.steps.06.item2
3. 提供商密钥
- 音声:OpenAI → Groq → Deepgram → Google
- 画像:OpenAI → Anthropic → Google → MiniMax
- 動画:Google
ReferenceNodesMediaUnderstandingPage.steps.06.disable
{
tools: {
media: {
audio: {
enabled: false,
},
},
},
}ReferenceNodesMediaUnderstandingPage.steps.06.note
機能(选项)
ReferenceNodesMediaUnderstandingPage.steps.07.p1
ReferenceNodesMediaUnderstandingPage.steps.07.p2
- openai、anthropic、minimax:画像
- google(Gemini API):画像 + 音声 + 動画
- groq:音声
- deepgram:音声
ReferenceNodesMediaUnderstandingPage.steps.07.p3
ReferenceNodesMediaUnderstandingPage.steps.07.p4
ReferenceNodesMediaUnderstandingPage.steps.08.title
| 機能 | 提供商集成 | 注釈 |
| ---- |
ReferenceNodesMediaUnderstandingPage.steps.08.p3
| 音频 | OpenAI、Groq、Deepgram、Google | 提供商転写(Whisper/Deepgram/Gemini)。 |
| 视频 | Google(Gemini API) | 提供商视频理解。 |
推荐提供商
画像
ReferenceNodesMediaUnderstandingPage.steps.09.imageItem1
ReferenceNodesMediaUnderstandingPage.steps.09.imageItem2
音声
- ''openai/gpt-4o-mini-transcribe''、''groq/whisper-large-v3-turbo''、或 ''deepgram/nova-3''。
- CLI 回退:''whisper-cli''(whisper-cpp)或 ''whisper''。
- Deepgram 设置:''Deepgram(音声転写)''。
動画
ReferenceNodesMediaUnderstandingPage.steps.09.videoItem1
ReferenceNodesMediaUnderstandingPage.steps.09.videoItem2
附件策略
ReferenceNodesMediaUnderstandingPage.steps.10.p1
- ''mode'':''first''(默认)或 ''all''
ReferenceNodesMediaUnderstandingPage.steps.10.item2
- ''prefer'':''first''、''last''、''path''、''url''
ReferenceNodesMediaUnderstandingPage.steps.10.p2
设置例
#
1) 分钟享模型列表 + 覆盖
{
tools: {
media: {
models: [
{ provider: "openai", model: "gpt-5.2", capabilities: ["image"] },
{
provider: "google",
model: "gemini-3-flash-preview",
capabilities: ["image", "audio", "video"],
},
{
type: "cli",
command: "gemini",
args: [
"-m",
"gemini-3-flash",
"--allowed-tools",
"read_file",
"Read the media at {{MediaPath}} and describe it in <= {{MaxChars}} characters.",
],
capabilities: ["image", "video"],
},
],
audio: {
attachments: { mode: "all", maxAttachments: 2 },
},
video: {
maxChars: 500,
},
},
},
}#
ReferenceNodesMediaUnderstandingPage.steps.13.title
{
tools: {
media: {
audio: {
enabled: true,
models: [
{ provider: "openai", model: "gpt-4o-mini-transcribe" },
{
type: "cli",
command: "whisper",
args: ["--model", "base", "{{MediaPath}}"],
},
],
},
video: {
enabled: true,
maxChars: 500,
models: [
{ provider: "google", model: "gemini-3-flash-preview" },
{
type: "cli",
command: "gemini",
args: [
"-m",
"gemini-3-flash",
"--allowed-tools",
"read_file",
"Read the media at {{MediaPath}} and describe it in <= {{MaxChars}} characters.",
],
},
],
},
},
},
}#
ReferenceNodesMediaUnderstandingPage.steps.14.title
{
tools: {
media: {
image: {
enabled: true,
maxBytes: 10485760,
maxChars: 500,
models: [
{ provider: "openai", model: "gpt-5.2" },
{ provider: "anthropic", model: "claude-opus-4-5" },
{
type: "cli",
command: "gemini",
args: [
"-m",
"gemini-3-flash",
"--allowed-tools",
"read_file",
"Read the media at {{MediaPath}} and describe it in <= {{MaxChars}} characters.",
],
},
],
},
},
},
}#
ReferenceNodesMediaUnderstandingPage.steps.15.title
{
tools: {
media: {
image: {
models: [
{
provider: "google",
model: "gemini-3-pro-preview",
capabilities: ["image", "video", "audio"],
},
],
},
audio: {
models: [
{
provider: "google",
model: "gemini-3-pro-preview",
capabilities: ["image", "video", "audio"],
},
],
},
video: {
models: [
{
provider: "google",
model: "gemini-3-pro-preview",
capabilities: ["image", "video", "audio"],
},
],
},
},
},
}状态输出
ReferenceNodesMediaUnderstandingPage.steps.16.p1
📎 Media: image ok (openai/gpt-5.2) · audio skipped (maxBytes)
ReferenceNodesMediaUnderstandingPage.steps.16.p2
注意
ReferenceNodesMediaUnderstandingPage.steps.17.item1
ReferenceNodesMediaUnderstandingPage.steps.17.item2
ReferenceNodesMediaUnderstandingPage.steps.17.item3
関連文档
- ''设置''
ReferenceNodesMediaUnderstandingPage.steps.18.item2