Gemini 多模态能力调用实战
Gemini 原生支持图像、音频、视频等多种输入模态,这使它在一众大语言模型中显得格外突出。对于开发者来说,如何高效地通过 API 调用这些多模态能力,是值得深入掌握的技能。本文将通过完整的代码示例,带你快速上手。
## 环境准备
在调用 Gemini API 之前,需要安装 Google 官方的 `google-generativeai` Python SDK。你可以通过 pip 一键安装:
```bash pip install google-generativeai ```
接下来,获取你的 API Key,并初始化客户端:
```python import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY") model = genai.GenerativeModel("gemini-1.5-flash") ```
## 图像理解实战
Gemini 可以直接接收图片并进行问答。下面的例子演示了如何让模型分析一张猫咪图片的内容。
```python import PIL.Image
img = PIL.Image.open("cat.jpg") response = model.generate_content(["请用中文描述这张图片里猫咪的特征和动作。", img]) print(response.text) ```
如果你想同时分析多张图片,也很简单:
```python imgs = [PIL.Image.open("img1.jpg"), PIL.Image.open("img2.jpg")] prompt = "这两张图片有什么共同点?" response = model.generate_content([prompt] + imgs) print(response.text) ```
SDK 会直接在请求中把图像编码为 Base64,无需手动处理复杂的 MIME 类型。
## 音频处理技巧
对于音频文件(如 MP3、WAV 等),可以将其作为 Blob 传入。例如,让 Gemini 总结一段会议录音:
```python import pathlib
audio_path = pathlib.Path("meeting.mp3") audio_blob = genai.upload_file(audio_path, mime_type="audio/mpeg")
response = model.generate_content(["请将这段录音的文字内容总结成三个要点。", audio_blob]) print(response.text) ```
注意,大文件需要使用 `files.upload` 先上传,并等待文件状态变为 `ACTIVE` 后才能用于生成。SDK 的 `genai.upload_file` 封装了这一过程,使用起来比较方便。
## 视频理解示例
视频可以视为连续的图像帧与音频流的结合。Gemini 能够从视频中提取关键信息。这里演示上传一段 MP4 视频,然后询问其中的事件:
```python video_path = pathlib.Path("demo.mp4") video_file = genai.upload_file(video_path, mime_type="video/mp4")
# 等待文件处理完成 import time while video_file.state.name == "PROCESSING": time.sleep(2) video_file = genai.get_file(video_file.name)
response = model.generate_content(["视频中发生了什么?请用中文概括。", video_file]) print(response.text) ```
对于较短的视频(小于 2 分钟),通常会很快完成处理。更长的视频则需要耐心等待。
## 多模态组合调用
真正强大的地方在于,你可以将文本、图像、音频、视频混合在一个请求里。例如,结合产品图片与语音反馈,让模型给出综合分析:
```python img = PIL.Image.open("product.jpg") audio = genai.upload_file("feedback.wav", mime_type="audio/wav")
prompt = "根据图片中的产品和用户录音反馈,生成一份简短的产品改进建议。" response = model.generate_content([prompt, img, audio]) print(response.text) ```
Gemini 会自行理解不同模态之间的关联,并生成连贯的回答。这种跨模态融合能力在客服分析、内容审核、智能教育等场景中极具潜力。
## 注意事项
实际开发中需留意三点:第一,不同模型版本对模态支持的范围不同,`gemini-1.5-flash` 和 `gemini-1.5-pro` 均支持图像、音频、视频,而某些旧版可能只支持文本;第二,文件通过 API 上传后会保留 48 小时,过期需重新上传;第三,对于过大的视频或音频,建议先用工具压缩,以降低延迟和成本。
## 稳定的 API 访问方案
如果你在国内访问 Gemini API 不够稳定,或者希望一个 Key 通吃多个主流模型,可以考虑使用 **TokenPocket API 中转站**(https://tokenpocket.site)。它提供 DeepSeek、Qwen、Claude、Gemini 等模型按量计费,支持 USDT 直接支付,注册就送免费额度,让多模态开发更加灵活高效。