多模态 AI 应用开发
输入不再局限于文字:图片能看懂,语音能听懂,视频能理解。多模态应用的核心是把“每种模态”都管好。
一、常见接入方式
- 视觉模型:
image_url直传图片,适合识图、OCR、UI 理解 - 语音:ASR(转文字)与 TTS(文字转语音)分别调用
- 统一入口:部分模型支持文本 + 图片混合推理
const resp = await fetch('/v1/chat/completions', {
method: 'POST',
headers: { 'Content-Type': 'application/json' },
body: JSON.stringify({
model: 'gpt-4o',
messages: [{
role: 'user',
content: [
{ type: 'text', text: '这张图里有什么设备?' },
{ type: 'image_url', image_url: { url: photoUrl } }
]
}]
})
});
二、工具集成
多模态常常与工具链协同:先识图,再根据结果触发搜索或写代码。把模型输出结构化,与上游任务串成流水线。
三、工程坑位
- 图片上传前做压缩与大小限制
- 音频先转码(mp3/wav)、分段再送 ASR
- 给每类调用设超时与重试
- 记住:模态越多,链路越脆弱,越需要监控
四、适合的场景
智能客服(截图 + 语音)、会议纪要(音频 + 文档)、数据看板问答(图表识别)都是典型落地点。