文档 · 重排序

把检索结果的顺序修回来的那一步

向量检索能给你候选,给不了你顺序。auto/rerank 拿一段查询和一批文档打分,然后按分数还给你——走 POST /v1/rerank,返回形状和现成的 rerank 客户端对得上。

怎么调

curl https://tokenexchage.com/v1/rerank \
  -H "Authorization: Bearer sk-你的key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "auto/rerank",
    "query": "怎么轮换 API key?",
    "documents": [
      "控制台里可以轮换 key。",
      "计费按请求次数算。",
      "轮换之后旧 key 立刻失效。"
    ],
    "top_n": 2
  }'
{
  "results": [
    { "index": 2, "relevance_score": 0.93 },
    { "index": 0, "relevance_score": 0.71 }
  ],
  "usage": { … }
}

index 指的是你传进去的 documents 数组里的位置——默认不回显原文。加 return_documents: true,每条结果会多一个 document 字段。

它在你流水线里的位置

检索通常是两段。第一段用向量做快速近似搜索,top_k 故意开大一点,因为这个阶段召回比精确重要。第二段对这批候选做更慢、更准的排序。

auto/rerank 就是第二段。当你的 top_k 明显大于真正喂给模型的条数时,它值得加上——多数情况都是这样,因为答案通常在前二十条里,但很少正好在第一条。

它和向量别名配套:向量算一次存起来,查询时再用重排序。

参数

字段必填说明
model是auto/rerank
query是查询串
documents是字符串数组
top_n否只要最好的 N 条
return_documents否把原文和分数一起返回

别名背后只有一个模型。换重排序模型会在不告诉你的情况下改变结果顺序——同一个查询,返回的排序不一样,而返回里没有任何一处看着异常。失败反而更安全。

其他能力

同一套命名,一个能力一个别名,都在 /v1/models 里:

embedding

auto/embed

第一段。1024 维向量

tts

auto/tts

文字转语音

asr

auto/asr

语音转文字

image

auto/image

文生图

video

auto/video

文生视频,异步