一、什么是 OpenAI Python 库1.1 一句话定义openai是 OpenAI 公司官方发布的 Python 客户端库。它把所有与 OpenAI 服务器通信的底层细节HTTP 请求、身份验证、JSON 解析、错误重试、流式传输全部封装好了让你只需要写几行 Python 代码就能调用 GPT、DALL·E、Whisper 等顶级 AI 模型。1.2 生活比喻┌─────────────────────────────────────────────────────────────────────┐ │ │ │ 没有 openai 库直接写 HTTP 请求 │ │ → 相当于你自己造一辆车去目的地 │ │ → 要自己组装引擎、轮子、方向盘写 URL、Header、Body │ │ → 还要自己处理抛锚错误处理、加油Token 管理 │ │ │ │ 有 openai 库 │ │ → 相当于你打了一辆出租车 │ │ → 你只需要说去哪里传参数 │ │ → 司机库帮你处理一切驾驶细节 │ │ │ │ 你的 Python 程序 │ │ │ │ │ │ client.chat.completions.create(...) │ │ ▼ │ │ openai 库帮你组装请求、发送、接收、解析 │ │ │ │ │ │ HTTPS POST → api.openai.com │ │ ▼ │ │ OpenAI 服务器运行 GPT/DALL-E/Whisper 模型 │ │ │ │ │ │ 返回 JSON 响应 │ │ ▼ │ │ openai 库帮你解析 JSON → Python 对象 │ │ │ │ │ ▼ │ │ 你拿到结果response.choices[0].message.content │ │ │ └─────────────────────────────────────────────────────────────────────┘1.3 openai 库能做什么功能全景图功能模块对应模型用途文本生成GPT-4o / GPT-4 / GPT-3.5写文章、写代码、翻译、摘要、对话图像生成DALL·E 3 / DALL·E 2根据文字描述生成图片图像编辑DALL·E 2对已有图片进行局部修改嵌入向量text-embedding-3语义搜索、文本分类、聚类、RAG语音转文字Whisper音频/视频转录、字幕生成文字转语音TTS-1 / TTS-1-HD朗读文章、有声书、语音助手微调基于 GPT-3.5/4用自有数据训练专属模型助手GPT-4 工具构建有记忆、能调工具的复杂 AI 应用函数调用GPT-4 / GPT-3.5让 AI 调用外部 API、执行代码1.4 openai 库 vs 直接用 requests# 方式1直接用 requests麻烦 import requests import json url https://api.openai.com/v1/chat/completions headers { Authorization: Bearer sk-你的密钥, Content-Type: application/json, } body { model: gpt-3.5-turbo, messages: [{role: user, content: 你好}], temperature: 0.7, } response requests.post(url, headersheaders, jsonbody, timeout60) if response.status_code 200: data response.json() reply data[choices][0][message][content] print(reply) elif response.status_code 429: print(请求太频繁请稍后重试) elif response.status_code 401: print(密钥无效) elif response.status_code 500: print(服务器错误) # ... 还要处理流式、重试、超时等各种情况 # 方式2用 openai 库简洁 from openai import OpenAI client OpenAI() response client.chat.completions.create( modelgpt-3.5-turbo, messages[{role: user, content: 你好}], ) print(response.choices[0].message.content) # 对比 # - 不需要手动拼 URL # - 不需要手动设置 Header # - 不需要手动解析 JSON # - 不需要手动处理各种 HTTP 状态码 # - 自带类型提示IDE 自动补全 # - 自带重试机制二、安装与环境配置2.1 安装# 基础安装 pip install openai # 验证安装 python -c import openai; print(openai.__version__) # 输出1.35.x确保是 1.x 版本 # ⚠️ 注意openai 库在 2023 年底发布了 v1.0 大版本更新 # 旧版语法openai.ChatCompletion.create已废弃 # 新版语法client.chat.completions.create是当前标准 # 如果你跟着旧教程学代码会报错2.2 获取 API Key步骤 1. 访问 https://platform.openai.com 2. 注册/登录账号 3. 点击左侧菜单 API Keys 4. 点击 Create new secret key 5. 复制生成的密钥格式sk-proj-xxxxxxxx 6. ⚠️ 只显示一次务必保存好2.3 配置 API Key三种方式# 方式1环境变量最推荐 # 在终端设置Linux/macOS # export OPENAI_API_KEYsk-proj-你的密钥 # 在终端设置Windows CMD # set OPENAI_API_KEYsk-proj-你的密钥 # 在终端设置Windows PowerShell # $env:OPENAI_API_KEYsk-proj-你的密钥 # Python 代码中直接创建 client自动读取环境变量 from openai import OpenAI client OpenAI() # 自动从 OPENAI_API_KEY 环境变量读取 # 方式2直接传入仅测试用 from openai import OpenAI client OpenAI(api_keysk-proj-你的密钥) # ⚠️ 绝对不要把密钥提交到 Git # 方式3用 .env 文件项目推荐 # 1. 安装pip install python-dotenv # 2. 在项目根目录创建 .env 文件 # OPENAI_API_KEYsk-proj-你的密钥 # 3. 在 .gitignore 中添加 .env防止提交到 Git # 4. Python 代码 from dotenv import load_dotenv import os load_dotenv() # 自动加载 .env 文件 from openai import OpenAI client OpenAI(api_keyos.getenv(OPENAI_API_KEY))2.4 Client 对象详解from openai import OpenAI # Client 是所有 API 调用的入口 client OpenAI( api_keysk-proj-xxx, # API 密钥 base_urlhttps://api.openai.com/v1, # API 地址默认值 timeout60.0, # 请求超时秒 max_retries2, # 失败自动重试次数 ) # 如果你用的是代理/中转服务修改 base_url # client OpenAI( # api_keysk-xxx, # base_urlhttps://your-proxy.com/v1 # ) # Client 对象包含所有功能模块 # client.chat → 对话补全 # client.images → 图像生成 # client.embeddings → 文本嵌入 # client.audio → 语音处理 # client.files → 文件管理 # client.fine_tuning → 微调 # client.beta → 助手Assistants # client.models → 模型列表三、核心概念详解3.1 Token词元—— 计费单位# Token 是 AI 处理文本的最小单位 # 英文大约 1 个单词 ≈ 1~1.5 个 token # 中文大约 1 个汉字 ≈ 1.5~2 个 token # 标点、空格也算 token # 例子 Hello world → 约 2 个 token 你好世界 → 约 5 个 token Python是一种编程语言 → 约 10 个 token # Token 影响 # 1. 费用按 input_tokens output_tokens 计费 # 2. 上下文窗口模型一次能处理的最大 token 数 # - GPT-3.5-turbo约 16K tokens # - GPT-4约 128K tokens # - GPT-4o约 128K tokens # 查看一次请求消耗了多少 token response client.chat.completions.create( modelgpt-3.5-turbo, messages[{role: user, content: 你好}] ) print(response.usage) # CompletionUsage(prompt_tokens9, completion_tokens12, total_tokens21) print(f输入{response.usage.prompt_tokens} tokens) print(f输出{response.usage.completion_tokens} tokens) print(f总计{response.usage.total_tokens} tokens)3.2 Model模型—— AI 的大脑# 查看可用模型列表 from openai import OpenAI client OpenAI() models client.models.list() for model in models.data: print(model.id) # 常用模型对比 # ┌──────────────────┬──────────┬──────────┬──────────────────┐ # │ 模型名称 │ 速度 │ 智能 │ 适用场景 │ # ├──────────────────┼──────────┼──────────┼──────────────────┤ # │ gpt-4o │ 快 │ 最强 │ 复杂推理、多模态 │ # │ gpt-4o-mini │ 最快 │ 较强 │ 日常对话、轻量任务│ # │ gpt-4-turbo │ 中 │ 很强 │ 长文本、代码 │ # │ gpt-3.5-turbo │ 快 │ 一般 │ 简单任务、低成本 │ # │ dall-e-3 │ 慢 │ - │ 图像生成 │ # │ whisper-1 │ 中 │ - │ 语音转文字 │ # │ tts-1 │ 快 │ - │ 文字转语音 │ # └──────────────────┴──────────┴──────────┴──────────────────┘3.3 Temperature温度—— 控制创造力# temperature 控制输出的随机性/创造性 # 范围0.0 ~ 2.0 # temperature 0 # → 最确定性的输出每次几乎一样 # → 适合事实问答、代码生成、数据提取 # temperature 0.7默认 # → 平衡创造力和准确性 # → 适合日常对话、写作 # temperature 1.0~2.0 # → 最随机、最有创意 # → 适合头脑风暴、诗歌、故事创作 # 示例对比 from openai import OpenAI client OpenAI() prompt 给一只猫取个名字 # 低温度 → 保守、常见 response client.chat.completions.create( modelgpt-3.5-turbo, messages[{role: user, content: prompt}], temperature0.1 ) print(f低温(0.1){response.choices[0].message.content}) # 可能输出小花、咪咪很常见 # 高温度 → 创意、独特 response client.chat.completions.create( modelgpt-3.5-turbo, messages[{role: user, content: prompt}], temperature1.5 ) print(f高温(1.5){response.choices[0].message.content}) # 可能输出量子毛球、薛定谔的喵酱很独特3.4 max_tokens —— 控制输出长度# max_tokens 限制模型最多生成多少个 token # 注意这不是必须生成这么多而是最多生成这么多 response client.chat.completions.create( modelgpt-3.5-turbo, messages[{role: user, content: 写一首关于春天的诗}], max_tokens50 # 最多输出约25个汉字 ) # 模型可能在 50 token 内就写完了也可能被截断四、文本生成Chat Completions⭐ 最核心功能4.1 消息结构详解# messages 是一个列表每个元素是一个字典 # 必须包含 role 和 content 两个键 messages [ # system设定 AI 的身份、规则、限制可选但强烈推荐 { role: system, content: 你是一位资深Python程序员回答简洁明了代码必须有注释。 }, # user用户的输入 { role: user, content: 如何读取CSV文件 }, # assistantAI 之前的回复多轮对话时需要 { role: assistant, content: 使用 pandas 库\nimport pandas as pd\ndf pd.read_csv(data.csv) }, # user用户的新问题 { role: user, content: 如果文件是GBK编码怎么办 }, ]4.2 三种角色的作用# system系统提示 # 作用设定 AI 的人设和行为规则 # 特点优先级最高AI 会优先遵守 system 的指令 # 比喻给演员的角色说明书 {role: system, content: 你是一个严厉但公正的数学老师} {role: system, content: 你只能用中文回答每次回答不超过100字} {role: system, content: 你是JSON格式化助手只输出JSON不输出其他任何文字} # user用户消息 # 作用用户的提问、指令、输入 # 比喻观众对演员说的话 {role: user, content: 帮我写一个排序算法} {role: user, content: 把这段话翻译成英文今天天气真好} # assistantAI回复 # 作用记录 AI 之前说过的话提供上下文 # 比喻演员之前说过的台词让演员记住自己说了什么 {role: assistant, content: 好的这是冒泡排序的实现...}4.3 最简单的完整示例from openai import OpenAI # 第1步创建客户端 client OpenAI() # 第2步调用 API response client.chat.completions.create( modelgpt-3.5-turbo, # 使用哪个模型 messages[ # 对话内容 {role: user, content: 11等于几} ], ) # 第3步提取回复 # response 的结构 # response # ├── .id → 请求唯一ID # ├── .model → 实际使用的模型 # ├── .choices → 回复列表通常只有1个 # │ └── [0] # │ ├── .message → 消息对象 # │ │ ├── .role → assistant # │ │ └── .content → 回复文本 ⭐ 这是你要的 # │ ├── .finish_reason → 结束原因stop/length # │ └── .index → 索引 # ├── .usage → token 用量 # │ ├── .prompt_tokens → 输入 token 数 # │ ├── .completion_tokens → 输出 token 数 # │ └── .total_tokens → 总 token 数 # └── .created → 时间戳 reply response.choices[0].message.content print(reply) # 11等于2。 # 查看 token 消耗 print(f消耗 {response.usage.total_tokens} 个 token)4.4 带 system 提示的示例from openai import OpenAI client OpenAI() # 场景让 AI 扮演一个翻译官 response client.chat.completions.create( modelgpt-3.5-turbo, messages[ { role: system, content: 你是一个专业的中英翻译官。 规则 1. 如果用户输入中文翻译成英文 2. 如果用户输入英文翻译成中文 3. 只输出翻译结果不要解释 4. 保持原文的语气和风格 }, { role: user, content: 今天的会议推迟到下午三点 } ], temperature0.3, # 翻译需要准确温度低一些 ) print(response.choices[0].message.content) # Todays meeting has been postponed to 3 PM.4.5 多轮对话带记忆from openai import OpenAI client OpenAI() # 关键把整个对话历史都传给 API # AI 本身没有记忆每次调用都是独立的 # 所谓的记忆就是你把之前的对话都传进去 # 第1轮对话 messages [ {role: system, content: 你是一个友好的助手回答简洁。}, {role: user, content: 我叫小明我今年25岁。} ] response client.chat.completions.create( modelgpt-3.5-turbo, messagesmessages ) ai_reply_1 response.choices[0].message.content print(fAI{ai_reply_1}) # 你好小明很高兴认识你。 # 把 AI 的回复加入历史 messages.append({role: assistant, content: ai_reply_1}) # 第2轮对话 messages.append({role: user, content: 我叫什么名字}) response client.chat.completions.create( modelgpt-3.5-turbo, messagesmessages # 传完整历史 ) ai_reply_2 response.choices[0].message.content print(fAI{ai_reply_2}) # 你叫小明。因为历史里有这个信息 # 把 AI 的回复加入历史 messages.append({role: assistant, content: ai_reply_2}) # 第3轮对话 messages.append({role: user, content: 我几岁}) response client.chat.completions.create( modelgpt-3.5-turbo, messagesmessages ) print(fAI{response.choices[0].message.content}) # 你今年25岁。4.6 多轮对话的完整交互版本from openai import OpenAI client OpenAI() def chat_loop(): 交互式聊天机器人 messages [ {role: system, content: 你是一个知识渊博且幽默的助手。} ] print( AI 助手已就绪输入 quit 退出) print(- * 40) while True: # 获取用户输入 user_input input(\n你).strip() if user_input.lower() in (quit, exit, q): print( 再见) break if not user_input: continue # 添加用户消息 messages.append({role: user, content: user_input}) # 调用 API response client.chat.completions.create( modelgpt-3.5-turbo, messagesmessages, temperature0.7, ) # 提取回复 ai_reply response.choices[0].message.content print(f\nAI{ai_reply}) # 添加 AI 回复到历史 messages.append({role: assistant, content: ai_reply}) # ⚠️ 防止历史太长超出上下文窗口 # 简单策略只保留最近 20 条消息 system if len(messages) 21: messages [messages[0]] messages[-20:] chat_loop()4.7 流式输出打字机效果from openai import OpenAI client OpenAI() # 普通调用等 AI 全部生成完才返回可能等很久 # 流式调用AI 每生成几个字就立刻推送给你 response client.chat.completions.create( modelgpt-3.5-turbo, messages[ {role: user, content: 写一首关于秋天的短诗} ], streamTrue, # ⭐ 开启流式 ) # response 现在是一个生成器generator逐块返回 full_reply print(AI, end) for chunk in response: # 每个 chunk 包含一小段文本 # chunk.choices[0].delta.content 是当前这一小段 # 第一个 chunk 的 delta 可能包含 role # 最后一个 chunk 的 delta.content 可能是 None if chunk.choices[0].delta.content is not None: text chunk.choices[0].delta.content print(text, end, flushTrue) # 实时打印不换行 full_reply text print() # 最后换行 print(f\n完整回复{full_reply})4.8 流式输出的详细解释# 流式返回的 chunk 结构 # chunk # ├── .id # ├── .choices # │ └── [0] # │ ├── .delta → 增量内容不是完整内容 # │ │ ├── .role → 只在第一个 chunk 出现 # │ │ └── .content → 当前这一小段文字可能是None # │ ├── .finish_reason → 只在最后一个 chunk 出现stop # │ └── .index # └── .created # 为什么需要 flushTrue # Python 的 print 默认有缓冲区 # 如果不 flush文字会攒够一批才显示 # flushTrue 强制立即输出到屏幕4.9 n 参数 —— 一次生成多个回复from openai import OpenAI client OpenAI() # n3让模型生成3个不同的回复供你选择 response client.chat.completions.create( modelgpt-3.5-turbo, messages[{role: user, content: 给咖啡店取个名字}], n3, # 生成3个候选 temperature1.0, # 温度高一些让3个结果差异更大 ) # 遍历所有候选回复 for i, choice in enumerate(response.choices, 1): print(f方案{i}{choice.message.content}) # 输出类似 # 方案1晨曦咖啡 # 方案2豆语时光 # 方案3半日闲咖啡馆4.10 stop 参数 —— 自定义停止词from openai import OpenAI client OpenAI() # 当模型生成的文本中包含 stop 中的内容时立即停止 response client.chat.completions.create( modelgpt-3.5-turbo, messages[ {role: user, content: 列出5种水果每行一个} ], stop[\n4], # 遇到第4个就停只要前3个 ) print(response.choices[0].message.content) # 只会输出前3种水果 # 常见用法 # stop[\n] → 只生成一行 # stop[。] → 遇到句号就停 # stop[END] → 遇到自定义标记就停4.11 完整参数列表response client.chat.completions.create( # 必填参数 modelgpt-3.5-turbo, # 模型名称 messages[...], # 消息列表 # 可选参数 temperature0.7, # 随机性0~2 top_p1.0, # 核采样与temperature二选一调 n1, # 生成几个候选回复 streamFalse, # 是否流式输出 stopNone, # 停止词列表 max_tokensNone, # 最大输出token数 presence_penalty0.0, # 主题惩罚-2~2越大越不愿重复话题 frequency_penalty0.0, # 频率惩罚-2~2越大越不愿重复用词 logit_biasNone, # 调整特定token的概率 userNone, # 用户标识用于OpenAI监控滥用 response_formatNone, # 响应格式如强制JSON seedNone, # 随机种子尽量可复现 toolsNone, # 可调用的工具/函数 tool_choiceNone, # 工具选择策略 )4.12 强制 JSON 输出from openai import OpenAI import json client OpenAI() # 让 AI 严格输出 JSON 格式 response client.chat.completions.create( modelgpt-3.5-turbo, messages[ { role: system, content: 你是一个数据提取助手。从用户输入中提取信息以JSON格式输出。 }, { role: user, content: 张三男28岁住在北京海淀区电话13800138000 } ], response_format{type: json_object}, # ⭐ 强制JSON输出 ) result response.choices[0].message.content data json.loads(result) # 安全解析为字典 print(data) # {name: 张三, gender: 男, age: 28, # address: 北京海淀区, phone: 13800138000}五、图像生成DALL·E5.1 文生图text-to-imagefrom openai import OpenAI client OpenAI() # DALL·E 3推荐 response client.images.generate( modeldall-e-3, prompt一只橘猫坐在窗台上窗外是下雨的城市夜景霓虹灯倒映在雨滴中吉卜力动画风格, size1024x1024, # 尺寸1024x1024, 1792x1024, 1024x1792 qualityhd, # 质量standard快或 hd更精细 stylevivid, # 风格vivid生动或 natural自然 n1, # DALL·E 3 只能为 1 ) # 获取结果 image_url response.data[0].url # 图片URL有效期1小时 print(f图片地址{image_url}) # ⚠️ DALL·E 3 会自动改写你的 prompt让它更详细 # 查看实际使用的 prompt print(f实际prompt{response.data[0].revised_prompt})5.2 下载生成的图片import requests from openai import OpenAI client OpenAI() response client.images.generate( modeldall-e-3, prompt水墨画风格的山水远山如黛近水含烟, size1792x1024, qualityhd, ) image_url response.data[0].url # 方法1用 requests 下载 img_response requests.get(image_url) with open(my_art.png, wb) as f: f.write(img_response.content) print(图片已保存为 my_art.png) # 方法2直接请求 base64不依赖URL有效期 response client.images.generate( modeldall-e-3, prompt一只熊猫在吃竹子, response_formatb64_json, # 返回 base64 编码 ) import base64 img_data base64.b64decode(response.data[0].b64_json) with open(panda.png, wb) as f: f.write(img_data)5.3 图像编辑DALL·E 2from openai import OpenAI client OpenAI() # 对已有图片进行局部编辑 # 需要原图 遮罩图mask # 遮罩图中透明区域alpha0的部分会被 AI 重新生成 response client.images.edit( modeldall-e-2, imageopen(photo.png, rb), # 原图必须是 PNG4MB maskopen(mask.png, rb), # 遮罩同尺寸 PNG prompt把天空变成紫色的晚霞, # 描述要修改的内容 n1, size1024x1024, ) edited_url response.data[0].url print(f编辑后的图片{edited_url})5.4 图像变体DALL·E 2# 生成一张图片的多个变体 response client.images.create_variation( modeldall-e-2, imageopen(original.png, rb), n4, # 生成4个变体 size1024x1024, ) for i, img in enumerate(response.data, 1): print(f变体{i}{img.url})5.5 写好 prompt 的技巧# ❌ 差的 prompt 一只猫 # ✅ 好的 prompt包含主体 动作 环境 风格 光线 构图 主体一只银白色的英短猫 动作慵懒地趴在沙发上 环境温暖的客厅背景有书架和绿植 风格摄影写实风格浅景深 光线午后的暖黄色阳光从窗户照进来 构图特写猫占画面2/3 # 组合成完整 prompt prompt ( 一只银白色的英短猫慵懒地趴在米色沙发上 背景是温馨的客厅有木质书架和绿色植物 午后暖黄色阳光从左侧窗户照入 摄影写实风格浅景深特写构图8K画质 )六、嵌入Embeddings6.1 什么是嵌入通俗解释# 嵌入 把文字变成一串数字向量 # 语义相近的文字 → 向量距离近 # 语义不同的文字 → 向量距离远 # 比喻 # 国王 → [0.8, 0.2, 0.9, ...] ┐ # 女王 → [0.79, 0.21, 0.88, ...] ┘ 距离很近语义相似 # # 国王 → [0.8, 0.2, 0.9, ...] ┐ # 香蕉 → [0.1, 0.9, 0.05, ...] ┘ 距离很远语义不同 # 用途 # 1. 语义搜索找意思相近的文档 # 2. 文本分类自动归类文章 # 3. 聚类把相似文本分组 # 4. RAG检索增强生成给 AI 提供相关知识 # 5. 推荐系统找相似内容6.2 生成嵌入向量from openai import OpenAI client OpenAI() # 单条文本 response client.embeddings.create( modeltext-embedding-3-small, # 或 text-embedding-3-large input机器学习是人工智能的一个分支 ) embedding response.data[0].embedding print(f向量维度{len(embedding)}) # 1536small或 3072large print(f前5个值{embedding[:5]}) # [0.0023, -0.0091, 0.0156, ...] # 批量文本更高效 texts [ Python是一种编程语言, Java也是一种编程语言, 今天天气真好, 我喜欢写代码, 明天会下雨吗, ] response client.embeddings.create( modeltext-embedding-3-small, inputtexts # 传入列表 ) # 获取所有向量 embeddings [item.embedding for item in response.data] print(f生成了 {len(embeddings)} 个向量) print(f每个向量维度{len(embeddings[0])})6.3 计算文本相似度from openai import OpenAI import numpy as np client OpenAI() def get_embedding(text): 获取文本的嵌入向量 response client.embeddings.create( modeltext-embedding-3-small, inputtext ) return np.array(response.data[0].embedding) def cosine_similarity(v1, v2): 计算余弦相似度0~1越大越相似 return np.dot(v1, v2) / (np.linalg.norm(v1) * np.linalg.norm(v2)) # 计算三句话的相似度 text_a 我喜欢编程 text_b 写代码是我的爱好 text_c 今天中午吃什么 emb_a get_embedding(text_a) emb_b get_embedding(text_b) emb_c get_embedding(text_c) sim_ab cosine_similarity(emb_a, emb_b) sim_ac cosine_similarity(emb_a, emb_c) print(f{text_a} vs {text_b}相似度 {sim_ab:.4f}) # ≈ 0.92很相似 print(f{text_a} vs {text_c}相似度 {sim_ac:.4f}) # ≈ 0.15不相似6.4 语义搜索实战from openai import OpenAI import numpy as np client OpenAI() # 知识库 documents [ Python是一种解释型编程语言适合数据科学和AI开发, Java是一种面向对象的编程语言广泛用于企业级开发, JavaScript是网页开发的核心语言运行在浏览器中, C是一种高性能编程语言常用于游戏开发和操作系统, 今天股市大涨上证指数突破3500点, Python的pandas库是数据分析的利器, ] # 1. 预先把所有文档转成向量 print(正在构建知识库向量...) doc_embeddings [] for doc in documents: resp client.embeddings.create( modeltext-embedding-3-small, inputdoc ) doc_embeddings.append(np.array(resp.data[0].embedding)) # 2. 用户提问 query 哪个语言适合做数据分析 query_resp client.embeddings.create( modeltext-embedding-3-small, inputquery ) query_embedding np.array(query_resp.data[0].embedding) # 3. 计算相似度并排序 similarities [] for i, doc_emb in enumerate(doc_embeddings): sim np.dot(query_embedding, doc_emb) / ( np.linalg.norm(query_embedding) * np.linalg.norm(doc_emb) ) similarities.append((sim, i)) similarities.sort(reverseTrue) # 按相似度降序 # 4. 输出最相关的结果 print(f\n查询{query}) print(最相关的文档) for sim, idx in similarities[:3]: print(f [{sim:.4f}] {documents[idx]}) # 输出 # [0.8921] Python是一种解释型编程语言适合数据科学和AI开发 # [0.8456] Python的pandas库是数据分析的利器 # [0.6234] Java是一种面向对象的编程语言广泛用于企业级开发七、语音转文字Whisper7.1 基本转录from openai import OpenAI client OpenAI() # 打开音频文件支持mp3, mp4, mpeg, mpga, m4a, wav, webm # 文件大小限制25MB audio_file open(meeting_recording.mp3, rb) # 调用转录接口 transcript client.audio.transcriptions.create( modelwhisper-1, fileaudio_file, # languagezh, # 指定语言可选自动检测也行 # response_formattext, # 输出格式json/text/srt/vtt/verbose_json ) print(transcript.text) # 大家好今天的会议主要讨论三个议题...7.2 带时间戳的转录from openai import OpenAI client OpenAI() audio_file open(podcast.mp3, rb) # 使用 verbose_json 格式获取时间戳 transcript client.audio.transcriptions.create( modelwhisper-1, fileaudio_file, response_formatverbose_json, timestamp_granularities[segment], # 段落级时间戳 ) print(f语言{transcript.language}) print(f总时长{transcript.duration}秒) print() for segment in transcript.segments: start segment[start] end segment[end] text segment[text] print(f[{start:.1f}s - {end:.1f}s] {text}) # 输出 # [0.0s - 3.2s] 大家好欢迎收听本期节目 # [3.2s - 7.8s] 今天我们要聊的是人工智能的未来 # [7.8s - 12.1s] 首先让我们回顾一下AI的发展历程7.3 生成字幕文件from openai import OpenAI client OpenAI() audio_file open(video_audio.mp3, rb) # 生成 SRT 字幕格式 transcript client.audio.transcriptions.create( modelwhisper-1, fileaudio_file, response_formatsrt, ) # 保存为字幕文件 with open(subtitle.srt, w, encodingutf-8) as f: f.write(transcript.text) print(字幕已保存为 subtitle.srt) # SRT 格式示例 # 1 # 00:00:00,000 -- 00:00:03,200 # 大家好欢迎收听本期节目 # # 2 # 00:00:03,200 -- 00:00:07,800 # 今天我们要聊的是人工智能的未来7.4 翻译转录# 把非英语音频直接翻译成英语文字 audio_file open(chinese_speech.mp3, rb) translation client.audio.translations.create( modelwhisper-1, fileaudio_file, ) print(translation.text) # 输出英文翻译由于内容较多本期分成15.1和15.2两部分请继续查看15.2