Gemini 多模态能力调用实战
随着多模态AI的爆发,Google的Gemini系列模型凭借原生多模态架构,能直接处理文本、图像、音频和视频。本文将带你从零调用Gemini API,实现图文混合输入,并对比不同模型版本的效果。
## 环境准备
首先安装官方Python SDK:
```bash pip install google-generativeai ```
然后获取API Key。如果你还没有,可以去Google AI Studio申请,或使用文末的TokenPocket中转站快速获取多个模型的Key。
## 最简调用:图文识别
导入库并配置Key:
```python import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY") model = genai.GenerativeModel('gemini-1.5-flash') ```
准备图片和文字提示。我们使用一张猫的图片,让模型描述它:
```python import PIL.Image
image = PIL.Image.open("cat.jpg") prompt = "请详细描述这张图片的内容,用中文回答。" response = model.generate_content([prompt, image]) print(response.text) ```
Gemini直接接受PIL图像作为输入,无需手动转base64,省去了大量样板代码。
## 多图对话与视频理解
多张图片同样简单,只需传入列表。下面实现对比两张图片的差异:
```python image1 = PIL.Image.open("before.jpg") image2 = PIL.Image.open("after.jpg") prompt = "这两张图有什么不同?请用中文列出至少3点变化。" response = model.generate_content([prompt, image1, image2]) print(response.text) ```
对于视频,Gemini可以上传后进行分析,或者直接传入视频文件的字节,但推荐使用更高级的File API。这里演示文件上传方式:
```python video_file = genai.upload_file(path="demo.mp4") response = model.generate_content(["总结这个视频讲了什么", video_file]) print(response.text) ```
注意:上传的视频会保留48小时,用完记得调用`video_file.delete()`。
## 流式与JSON输出
对于长文本生成,使用流式响应提升体验:
```python response = model.generate_content("写一篇500字关于AI生态的科幻短文", stream=True) for chunk in response: if chunk.text: print(chunk.text, end="") ```
如果想得到结构化数据,可请求JSON输出。Gemini支持通过系统提示强制返回JSON:
```python model = genai.GenerativeModel('gemini-1.5-pro', generation_config={"response_mime_type": "application/json"}) response = model.generate_content("用JSON列出3种濒危动物和其种群数量") print(response.text) ```
输出将是合法的JSON字符串。
## 安全设置与错误处理
实际应用中,需要过滤不安全内容并处理异常:
```python from google.generativeai.types import HarmCategory, HarmBlockThreshold
safe = { HarmCategory.HARM_CATEGORY_HARASSMENT: HarmBlockThreshold.BLOCK_ONLY_HIGH, HarmCategory.HARM_CATEGORY_HATE_SPEECH: HarmBlockThreshold.BLOCK_ONLY_HIGH, } model = genai.GenerativeModel('gemini-1.5-pro', safety_settings=safe)
try: response = model.generate_content("一些可能敏感的内容") print(response.text) except ValueError as e: print(f"请求被拦截:{e}") ```
## 不同模型版本对比
我们尝试同一张复杂图表,分别用gemini-1.5-flash和gemini-2.0-flash-exp测试(需提前开通):
```python for model_name in ["gemini-1.5-flash", "gemini-2.0-flash-exp"]: model = genai.GenerativeModel(model_name) response = model.generate_content(["请解析这张柱状图的数据和趋势", image]) print(f"--- {model_name} ---\n{response.text}\n") ```
你会发现新版本在图表推理、数值提取上更精准,但延迟稍高。日常使用中,flash版本足以应对大多数多模态任务,pro系列适合复杂逻辑。
## 便捷接入多模型:TokenPocket API中转站
如果你希望在同一应用中无缝切换DeepSeek、Qwen、Claude、Gemini等主流模型,并且只用一套API格式,TokenPocket中转站是个不错的选择。它兼容OpenAI接口标准,按量计费,无需单独对接每种模型的官方SDK。新用户注册即赠送免费额度,可直接体验Gemini多模态接口。
只需将base_url改为`https://tokenpocket.site/v1`,用你的TokenPocket Key替换原生Key,代码几乎无需改动——原生的图片传递方式同样适用,让你轻松构建多模型协同的AI应用。赶紧去试一下吧。