大模型 API 调用成本优化技巧
随着大模型 API 生态的成熟,开发者越来越容易将 AI 能力嵌入应用。但随之而来的调用成本也可能在不经意间飙升——一条无限制的长回复、一次重复的请求、一场未做缓存的批量测试,都可能在月底账单上留下刺眼的数字。本文分享几个经过实践检验的成本优化技巧,附上可直接运行的代码示例,帮你用更少的预算撬动更强的智能。 ### 1. 精准设置 max_tokens 很多调用习惯性地把 `max_tokens` 设得很大,或者根本不设置。模型会自动补全到一个较长的篇幅,而你很可能只用到前几个句子。合理估算任务所需的最大长度,能直接砍掉无意义的 token 消耗。 ```python import openai # 不推荐:无限制输出 # response = openai.ChatCompletion.create( # model="deepseek-chat", # messages=[{"role": "user", "