tencent cloud

Elasticsearch Service

调用原子服务推理

Download
聚焦模式
字号
最后更新时间: 2026-08-25 14:37:15
腾讯云 ES 提供了丰富的原子服务(参阅这里),在 ES 控制台左侧导航栏的“智能搜索开发”下,点击“原子服务”即可看到,它们可以通过 API 直接调用。
其中 Embedding,Rerank,LLM 等类型的原子服务可以通过 ES 的 inference 创建为推理端点。


通过原子服务创建推理端点

您可以将原子服务创建为一个 ES 的 inference 推理端点,这样在 ES 中需要通过 inference API 调用时(例如通过 ingest pipeline 写入、通过 knn 或者 semantic 方式搜索)可以直接调用。
PUT /_inference/text_embedding/tencentcloudapi_bge_base_zh-v1.5"
{
"service": "tencent_cloud_ai_search",
"service_settings": {
"secret_id": "AKIDI***********************",
"secret_key": "BQa*************************",
"url": "https://es.internal.tencentcloudapi.com",
"model_id": "bge-base-zh-v1.5",
"region": "ap-beijing",
"language": "zh-CN",
"action": "GetTextEmbedding",
"version": "2025-01-01"
}
}
备注1:密钥采用secret_id 和 secret_key的写法,注意云API key权限需包含ES接口调用。
备注2:url 需要以http/https 开头,默认不用修改
备注3:model_id 填模型名称,例如bge-base-zh-v1.5,Conan-embedding-v1 ,后续支持自定义模型
备注4:region 可填ap-beijing,当前原子服务暂部署在北京地域
备注5:其他字段一般不用改

参考:原子服务一览

Embedding 服务

Embedding 是一种将高维数据映射到低维空间的技术,通常用于将非结构化数据,如文本、图像或音频转化为向量表示,使其更容易输入机器模型进行处理,并且向量之间的距离可以反映对象之间的相似性。
接口文档请参见 获取特征向量
原子服务
token 限制
维度
语言
备注
bge-base-zh-v1.5
512
768
中文
bge 经典模型
KaLM-embedding-multilingual-mini-v1
131072
896
多语言
微信自研具有优质训练数据的自回归 LLM 的嵌入模型,适合超长文本、中英混合查询与多语言文档匹配场景
bge-m3
8194
1024
多语言
bge 经典模型
conan-embedding-v1
512
1792
中文
腾讯自研,中文场景去年在 MTEB 榜单一度综合排第一

Rerank 服务

重排是指在 RAG 过程中,通过评估文档与查询之间的相关性,将最相关的文档放在前面,确保语言模型在生成回答时优先考虑排名靠前的上下文,提高生成结果的准确性和可信度,也可以通过这种方式进行过滤,减少大模型成本。
接口文档请参见 重排序
原子服务
token 限制
语言
备注
bge-reranker-large
514
中文、英文
bge 经典模型
bge-reranker-v2-m3
8194
多语言
bge 经典模型

参考:Inference API 调用指引

Embedding API

在 ES 中创建原子服务 Embedding 模型,举例,名字为 tencentcloudapi_bge_base_zh-v1.5
(支持全量覆盖修改密钥)

curl -H "Content-Type: application/json" -XPUT "http://127.0.0.1:9200/_inference/text_embedding/tencentcloudapi_bge_base_zh-v1.5" -d '{
"service": "tencent_cloud_ai_search",
"service_settings": {
"secret_id": "AKIDI***********************",
"secret_key": "BQa*************************",
"url": "https://es.internal.tencentcloudapi.com",
"model_id": "bge-base-zh-v1.5",
"region": "ap-beijing",
"language": "zh-CN",
"action": "GetTextEmbedding",
"version": "2025-01-01"
}
}'
备注1:密钥采用 secret_id 和 secret_key 的写法,注意云 API key 权限需包含 ES 接口调用。
备注2:url 需要以 http/https 开头,默认不用修改
备注3:model_id 填模型名称,例如 bge-base-zh-v1.5,Conan-embedding-v1 ,后续支持自定义模型
备注4:region 可填 ap-beijing,当前原子服务暂部署在北京地域
备注 5:其他字段一般不用改
调用原子服务模型
单独执行向量化
curl -H "Content-Type: application/json" -XPOST "http://127.0.0.1:9200/_inference/text_embedding/tencentcloudapi_bge_base_zh-v1.5" -d '{
"input": ["中国","美国","英国"]
}'
查看模型
获取全部模型: GET /_inference/_all
或获取单个模型:
curl -XGET "http://127.0.0.1:9200/_inference/text_embedding/tencentcloudapi_bge_base_zh-v1.5"
返回如下信息:(会隐藏 api_key)
{
"models" : [
"model_id" : "tencentcloudapi_bge_base_zh-v1.5"
"task_type" : "text_embedding",
"service" : "tencent_cloud_ai_search",
"service_settings" : {
"model_id" : "bge-base-zh-v1.5"
"url" : "https://aisearch.test.tencentcloudapi.com",
"Language" : "zh-CN"
"region": "ap-guangzhou",
"action" : "GetTextEmbedding"
"version": "2025-01-01"
},
"task_settings" :{ }
}
]
}
创建基于原子服务模型的 pipeline
curl -X PUT "localhost:9200/_ingest/pipeline/tencentcloudapi_bge_base_zh-v1.5_embeddings?pretty" -H 'Content-Type: application/json' -d'
{
"processors": [
{
"inference": {
"model_id": "tencentcloudapi_bge_base_zh-v1.5",
"input_output": {
"input_field": "content",
"output_field": "content_embedding"
}
}
}
]
}
'
调用原子服务进行 bulk 写入
curl -u "elastic:changeme" -H "Content-Type: application/x-ndjson; charset=UTF-8" -XPOST "127.0.0.1:9200/vector_index/_bulk?pipeline=tencentcloudapi_bge_base_zh-v1.5_embeddings" -d '
{ "index" : {} }
{ "title" : "value1","content": "good day" }
'
调用原子服务进行向量相似度检索
curl -H "Content-Type: application/x-ndjson; charset=UTF-8" -XPOST "127.0.0.1:9200/vector_index/_search" -d '{
"knn": {
"field": "content_embedding",
"query_vector_builder": {
"text_embedding": {
"model_id": "tencentcloudapi_bge_base_zh-v1.5",
"model_text": "您需要向量化的原始文本"
}
},
"k": 10,
"num_candidates": 100
}}'

Rerank API

创建 原子服务 rerank 模型
(支持全量覆盖修改密钥)
curl -H "Content-Type: application/json" -XPUT "http://127.0.0.1:9200/_inference/rerank/tencentcloudapi_bge-reranker-large" -d '{
"service": "tencent_cloud_ai_search",
"service_settings": {
"secret_id": "AKIDI***********************",
"secret_key": "BQa*************************",
"url": "https://es.internal.tencentcloudapi.com",
"model_id": "bge-reranker-large",
"region": "ap-beijing",
"language": "zh-CN",
"action": "RunRerank",
"version": "2025-01-01"
},
"task_settings": {
"top_n": 10,
"return_documents": true
}
}'
备注1:密钥采用 secret_id 和 secret_key 的写法,注意云 API key 权限需包含 ES 接口调用
备注2:url 需要以 http/https 开头,默认不用修改
备注3:model_id 填模型名称,例如 bge-reranker-large ,后续支持自定义模型
备注4:region 可填 ap-beijing,当前原子服务暂时只部署在北京地域
调用原子服务 rerank 模型进行重排
curl -H "Content-Type: application/json" -XPOST "http://127.0.0.1:9200/_inference/rerank/tencentcloudapi_bge-reranker-large" -d '{
"query": "中国",
"input": ["美国","中国","英国"]
}'
查询+rerank
一体化请求
curl -H "Content-Type: application/json" -XGET "http://127.0.0.1:9200/vector_index/_search?pretty" -d '
{
"retriever": {
"tencent_cloud_ai_reranker": {
"retriever": {
"standard": {
"query": {
"match_all": { // 查询条件
}
}
}
},
"model_id": "tencentcloudapi_bge-reranker-large",
"rank_field": "content",
"rank_text": "nice day",
"rank_window_size": 10,
"min_score": 0.6
}
}
}'
curl -H "Content-Type: application/json" -XGET "http://127.0.0.1:9200/vector_index/_search?pretty" -d '
'

参考:Inference 批量获取、更新 API (8.16)

批量能力
基础使用方法:基于官方的获取、更新 API,参考上方官方文档
批量能力使用:自研增加批量的能力,参考下方示例
批量获取 Inference 示例
curl -H "Content-Type: application/json" -XGET "http://127.0.0.1:9200/_inference/completion/a*,b*"
curl -H "Content-Type: application/json" -XGET "http://127.0.0.1:9200/_inference/a*,b*"
批量更新 Inference 示例
curl -H "Content-Type: application/json" -XPUT "http://127.0.0.1:9200/_inference/rerank/a*,b*/_update" -d '{
"service_settings": {
"secret_id": "AKI3*************",
"secret_key": "GZ4*********"
}
}'
备注1:密钥采用 secret_id 和 secret_key 的写法,注意云 API key 权限需包含 ES 接口调用。

帮助和支持

本页内容是否解决了您的问题?

填写满意度调查问卷,共创更好文档体验。

文档反馈