Gemini 多模态能力调用实战

Gemini 原生支持图像、音频、视频等多种输入模态,这使它在一众大语言模型中显得格外突出。对于开发者来说,如何高效地通过 API 调用这些多模态能力,是值得深入掌握的技能。本文将通过完整的代码示例,带你快速上手。

## 环境准备

在调用 Gemini API 之前,需要安装 Google 官方的 `google-generativeai` Python SDK。你可以通过 pip 一键安装:

```bash pip install google-generativeai ```

接下来,获取你的 API Key,并初始化客户端:

```python import google.generativeai as genai

genai.configure(api_key="YOUR_API_KEY") model = genai.GenerativeModel("gemini-1.5-flash") ```

## 图像理解实战

Gemini 可以直接接收图片并进行问答。下面的例子演示了如何让模型分析一张猫咪图片的内容。

```python import PIL.Image

img = PIL.Image.open("cat.jpg") response = model.generate_content(["请用中文描述这张图片里猫咪的特征和动作。", img]) print(response.text) ```

如果你想同时分析多张图片,也很简单:

```python imgs = [PIL.Image.open("img1.jpg"), PIL.Image.open("img2.jpg")] prompt = "这两张图片有什么共同点?" response = model.generate_content([prompt] + imgs) print(response.text) ```

SDK 会直接在请求中把图像编码为 Base64,无需手动处理复杂的 MIME 类型。

## 音频处理技巧

对于音频文件(如 MP3、WAV 等),可以将其作为 Blob 传入。例如,让 Gemini 总结一段会议录音:

```python import pathlib

audio_path = pathlib.Path("meeting.mp3") audio_blob = genai.upload_file(audio_path, mime_type="audio/mpeg")

response = model.generate_content(["请将这段录音的文字内容总结成三个要点。", audio_blob]) print(response.text) ```

注意,大文件需要使用 `files.upload` 先上传,并等待文件状态变为 `ACTIVE` 后才能用于生成。SDK 的 `genai.upload_file` 封装了这一过程,使用起来比较方便。

## 视频理解示例

视频可以视为连续的图像帧与音频流的结合。Gemini 能够从视频中提取关键信息。这里演示上传一段 MP4 视频,然后询问其中的事件:

```python video_path = pathlib.Path("demo.mp4") video_file = genai.upload_file(video_path, mime_type="video/mp4")

# 等待文件处理完成 import time while video_file.state.name == "PROCESSING": time.sleep(2) video_file = genai.get_file(video_file.name)

response = model.generate_content(["视频中发生了什么?请用中文概括。", video_file]) print(response.text) ```

对于较短的视频(小于 2 分钟),通常会很快完成处理。更长的视频则需要耐心等待。

## 多模态组合调用

真正强大的地方在于,你可以将文本、图像、音频、视频混合在一个请求里。例如,结合产品图片与语音反馈,让模型给出综合分析:

```python img = PIL.Image.open("product.jpg") audio = genai.upload_file("feedback.wav", mime_type="audio/wav")

prompt = "根据图片中的产品和用户录音反馈,生成一份简短的产品改进建议。" response = model.generate_content([prompt, img, audio]) print(response.text) ```

Gemini 会自行理解不同模态之间的关联,并生成连贯的回答。这种跨模态融合能力在客服分析、内容审核、智能教育等场景中极具潜力。

## 注意事项

实际开发中需留意三点:第一,不同模型版本对模态支持的范围不同,`gemini-1.5-flash` 和 `gemini-1.5-pro` 均支持图像、音频、视频,而某些旧版可能只支持文本;第二,文件通过 API 上传后会保留 48 小时,过期需重新上传;第三,对于过大的视频或音频,建议先用工具压缩,以降低延迟和成本。

## 稳定的 API 访问方案

如果你在国内访问 Gemini API 不够稳定,或者希望一个 Key 通吃多个主流模型,可以考虑使用 **TokenPocket API 中转站**(https://tokenpocket.site)。它提供 DeepSeek、Qwen、Claude、Gemini 等模型按量计费,支持 USDT 直接支付,注册就送免费额度,让多模态开发更加灵活高效。

Read more

波场TRON转USDT为什么可以零手续费?原理详解

相信不少朋友在转移 USDT 时都会被“Gas 费”绊住脚:明明账户里有足额 USDT,却因为没有 TRX 而无法发起转账。这种尴尬在波场 TRON 网络上尤其常见,因为大部分用户以为 USDT 转账必须燃烧 TRX。但你是否见过一些钱包能实现 **零手续费** 转 USDT 甚至 USDD?背后并不是魔法,而是一套巧妙利用波场资源模型的方案。今天我们就来把这件事聊透。 ### 1. 波场的“资源”是怎么回事? 波场和以太坊不同,它不直接要求每笔交易都以特定代币支付手续费,而是设计了两种公共资源:**带宽(Bandwidth)** 和 **能量(Energy)**。 - **带宽**:一般用于普通 TRX 转账。每个账户每天有 1500 点免费带宽,足够完成一两笔简单的 TRX 转账。

By 罗本

AI 编程助手配置指南:Cursor/Cline 接入教程

如今 AI 编程助手已经深入开发流程,Cursor 和 Cline 是两款非常亮眼的工具。不过,无论是官方订阅费用还是国内访问限制,都让不少开发者望而却步。好消息是,这两款工具都支持自定义 API 端点,你可以接入手里的任何 OpenAI 兼容接口,灵活选择模型,成本也更可控。 下面这份指南将手把手带你完成配置,让你用上性价比更高的自定义模型。 ### 为什么需要自定义 API - **成本更低**:官方订阅通常按月付费,而 API 按量计费,轻度使用更划算。 - **模型自由**:你可以接入 DeepSeek、Qwen、Claude、Gemini 等多种模型,在不同任务之间灵活切换。 - **访问稳定**:搭配国内可直接访问的中转服务,不再担心网络问题。 ### Cursor 接入自定义 API Cursor 虽然内置了大量模型,但依然允许覆盖 OpenAI

By 罗本

波场转 USDT 零手续费?原理其实很简单

很多朋友第一次在波场(TRON)网络上转 USDT 时,都会被提醒:“账户中没有 TRX,无法支付手续费。”可没过多久,他们又发现有些钱包居然可以“免费”转 USDT,不需要提前准备 TRX,甚至全程零 Gas 费。这到底是怎么做到的?今天我们就来拆解一下背后的原理。 ### 波场的手续费:能量与带宽 波场网络没有采用传统的“每次转账必烧币”模式,而是设计了一套资源系统,由「带宽」和「能量」两部分组成。 - **带宽**:用于处理普通转账交易(如转账 TRX、TRC-10 代币)。每个账户每天都有 1500 点免费带宽,足够完成几笔简单的 TRX 转账。 - **能量**:执行智能合约需要消耗能量。USDT 是

By 罗本

DeepSeek API 接入教程:从注册到 Python 调用实战

随着大模型的普及,越来越多的开发者希望将 DeepSeek 的能力集成到自己的应用中。DeepSeek 提供了功能强大且价格合理的 API,本教程将带你从零开始,完成从注册到使用 Python 调用 API 的全过程。 ## 1. 准备工作:注册与获取 API Key 首先访问 DeepSeek 开放平台(platform.deepseek.com),使用邮箱或手机号注册账号。注册完成后进入控制台,在左侧导航栏找到「API Keys」页面,点击「创建新的 API Key」按钮。系统会生成一段以 `sk-` 开头的密钥,请务必复制并妥善保存,因为它只会显示这一次。 获取到 API Key 后,建议将它设置为环境变量,避免硬编码在代码中: ```bash export DEEPSEEK_API_

By 罗本