Google: Gemini Embedding 001
gemini-embedding-001- 输入 / 输出-50%
- $0.15 / $0.00$0.075 / $0.00
- 上下文
- 2K
- 模态
- 嵌入
Gemini Embedding 001 简介
Gemini Embedding 001 是 Google Gemini API 中仅支持文本的向量化(embedding)模型。它把文本转成能表达语义的向量,因此无需依赖共有关键词,就能把问题匹配到段落、对相关文档聚类,或支撑推荐。输出维度可在 128 到 3,072 之间调整,任务类型(task type)参数告诉模型这些向量将用于什么。
擅长的任务
- 任务类型参数,比如检索文档或语义相似度,可以让向量针对具体用途调优,而不是用一种通用的向量。
- 输出维度可从 3,072 缩减到最低 128,Google 指出较小维度的得分接近完整维度。
- 每个输入字符串都有自己的向量,适合每个文档都需要独立向量的批量建索引。
- 向量可以作为浮点数或 base64 返回,便于紧凑存储。
什么情况换别的模型
- 只支持文本输入,长度上限远低于新模型,长文档要先切块再向量化。
- 维度低于 3,072 的向量,需要你在做相似度搜索前自己做归一化。
- 它的向量空间与 gemini-embedding-2 不兼容,换模型意味着要对整个集合重新向量化。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
嵌入TokenLab 端点POST/v1/embeddingscurl -X POST "https://api.tokenlab.sh/v1/embeddings" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "dimensions": 768, "encoding_format": "float", "input": "Semantic search", "model": "gemini-embedding-001" }'
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
价格
每 1M token- TokenLab 价格
- 输入$0.075每 1M token输出$0.00每 1M token
- 官方价格
- 输入$0.15每 1M token输出$0.00每 1M token
折扣: -50%
| 官方价格每 1M token | TokenLab 价格每 1M token | 折扣 | |
|---|---|---|---|
| 输入 | $0.15 | $0.075 | -50% |
| 输出 | $0.00 | $0.00 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Gemini Embedding 001 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 gemini-embedding-001 完成一次 embedding,接口是 /v1/embeddings。返回结果和费用。
使用场景
问答检索
把文档分块向量化一次,每个问题用查询任务类型向量化,取出最近的分块提供给对话模型。
重复和近似重复检测
比较客服工单或商品描述的向量,找出表达不同但意思相同的条目。
主题聚类
按语义给反馈或文章分组,不必写关键词列表就能看到主题。
内容推荐
找出与读者刚读完的内容最近的向量,推荐相关文章。
提示词示例
把这 500 段帮助中心的内容向量化用于检索,并存储向量,让用户能用自然语言搜索。
找出语义上最接近这句话的五张工单:客户更换邮箱地址后无法重置密码。
对上个月的应用评价聚类:为每条评价生成向量,再把最近邻分到一组。
费用计算器
FAQ
Gemini Embedding 001 用来做什么?
针对文本的语义搜索与检索、聚类、分类和推荐。它把文本转成向量,含义相近的文本向量就靠得近。用任务类型参数说明你是在向量化文档、查询,还是在比较相似度。
Gemini Embedding 001 和 Gemini Embedding 2 有什么区别?
001 只处理文本,输入长度上限短得多,并使用任务类型参数。Embedding 2 接受更长的文本,并改为要求把任务指令写在提示词里。两者的向量不能互相比较。
应该选多少维度?
Google 推荐 768、1,536 或 3,072,允许 128 到 3,072 之间的任意值。较小的维度节省存储和搜索时间,得分接近完整维度。使用低于 3,072 的维度时,要自己对向量做归一化。
输入最长可以多长?
每个输入都有长度上限。较长的文档要拆成放得下的段落,分别向量化。按段落或标题切分,通常比固定长度切分的检索效果更好。
怎么调用?
使用标准的 embeddings 请求格式。发送模型名和输入文本或字符串列表,再从响应中读取向量。输出可以请求为浮点数或 base64。
Gemini Embedding 001 的费用是多少?
在 TokenLab 上,Gemini Embedding 001 的价格为 输入 $0.075 / 输出 $0.00 每 1M token。完整明细见上方价格表。
Gemini Embedding 001 应该使用哪个端点?
Gemini Embedding 001 使用 https://api.tokenlab.sh/v1/embeddings。代码写法见下方的请求示例。
Gemini Embedding 001 支持哪些操作?
Gemini Embedding 001 支持 嵌入。选了操作,上面会显示对应的端点和请求示例。
Gemini Embedding 001 对比
资料来源
审阅于 2026年10月2日