用例
Qwen3.8 Flash Next 用于长上下文
Qwen3.8 Flash Next 是检索和长文档工作流的快速、低成本选择。1M 上下文窗口可在单次 prompt 中包含检索材料,每百万 token 输入 $0.12、输出 $0.376。
$0.12 / $0.376 per 1M tokens
为什么适合 RAG
根据目录的 1M 上下文上限安排检索材料。每百万输入 token 价格为 $0.12。请使用自己的文档评估召回效果,尤其是在接近上限时。
RAG 流水线模式
检索最相关的段落,将它们放入 prompt,并要求模型根据段落回答。如果语料超过 1M,先按章节摘要再回答。
快速上手代码
python
from openai import OpenAI
client = OpenAI(
base_url="https://api.quicksilverpro.io/v1",
api_key="sk-qsp-...",
)
document = open("annual-report.txt").read()
resp = client.chat.completions.create(
model="qwen3.8-flash-next",
messages=[
{"role": "system", "content": "Answer using only the provided document."},
{"role": "user", "content": f"Document:
{document}
Question: What was free cash flow in Q3?"},
],
max_tokens=500,
)
print(resp.choices[0].message.content)常见问题
1M 是目录上限。关键检索场景建议结合向量搜索,把相关段落放在最前面。
此模型以非思考模式运行,无需为隐藏推理轨迹预留预算。
目录中的能力为 文本输入、文本输出、流式输出、工具调用,通过 Chat Completions、Responses 提供。生产使用前请测试多工具工作流。