文档 · 重排序
把检索结果的顺序修回来的那一步
向量检索能给你候选,给不了你顺序。auto/rerank 拿一段查询和一批文档打分,然后按分数还给你——走 POST /v1/rerank,返回形状和现成的 rerank 客户端对得上。
怎么调
curl https://tokenexchage.com/v1/rerank \
-H "Authorization: Bearer sk-你的key" \
-H "Content-Type: application/json" \
-d '{
"model": "auto/rerank",
"query": "怎么轮换 API key?",
"documents": [
"控制台里可以轮换 key。",
"计费按请求次数算。",
"轮换之后旧 key 立刻失效。"
],
"top_n": 2
}'
{
"results": [
{ "index": 2, "relevance_score": 0.93 },
{ "index": 0, "relevance_score": 0.71 }
],
"usage": { … }
}
index 指的是你传进去的 documents 数组里的位置——默认不回显原文。加 return_documents: true,每条结果会多一个 document 字段。
它在你流水线里的位置
检索通常是两段。第一段用向量做快速近似搜索,top_k 故意开大一点,因为这个阶段召回比精确重要。第二段对这批候选做更慢、更准的排序。
auto/rerank 就是第二段。当你的 top_k 明显大于真正喂给模型的条数时,它值得加上——多数情况都是这样,因为答案通常在前二十条里,但很少正好在第一条。
它和向量别名配套:向量算一次存起来,查询时再用重排序。
参数
| 字段 | 必填 | 说明 |
|---|---|---|
model | 是 | auto/rerank |
query | 是 | 查询串 |
documents | 是 | 字符串数组 |
top_n | 否 | 只要最好的 N 条 |
return_documents | 否 | 把原文和分数一起返回 |
别名背后只有一个模型。换重排序模型会在不告诉你的情况下改变结果顺序——同一个查询,返回的排序不一样,而返回里没有任何一处看着异常。失败反而更安全。
其他能力
同一套命名,一个能力一个别名,都在 /v1/models 里: