首页/用例/qwen3 用于 long-context
用例

Qwen3.8 Flash Next 用于长上下文

Qwen3.8 Flash Next 是检索和长文档工作流的快速、低成本选择。1M 上下文窗口可在单次 prompt 中包含检索材料,每百万 token 输入 $0.12、输出 $0.376。

$0.12 / $0.376 per 1M tokens

为什么适合 RAG

根据目录的 1M 上下文上限安排检索材料。每百万输入 token 价格为 $0.12。请使用自己的文档评估召回效果,尤其是在接近上限时。

RAG 流水线模式

检索最相关的段落,将它们放入 prompt,并要求模型根据段落回答。如果语料超过 1M,先按章节摘要再回答。

快速上手代码

python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.quicksilverpro.io/v1",
    api_key="sk-qsp-...",
)

document = open("annual-report.txt").read()

resp = client.chat.completions.create(
    model="qwen3.8-flash-next",
    messages=[
        {"role": "system", "content": "Answer using only the provided document."},
        {"role": "user", "content": f"Document:
{document}

Question: What was free cash flow in Q3?"},
    ],
    max_tokens=500,
)
print(resp.choices[0].message.content)

常见问题

1M 是目录上限。关键检索场景建议结合向量搜索,把相关段落放在最前面。

此模型以非思考模式运行,无需为隐藏推理轨迹预留预算。

目录中的能力为 文本输入、文本输出、流式输出、工具调用,通过 Chat Completions、Responses 提供。生产使用前请测试多工具工作流。

用你自己的 key 开始

获取 API Key