लंबे context के लिए Qwen3.8 Flash Next
Qwen3.8 Flash Next retrieval और लंबे दस्तावेज़ों के लिए तेज़ और कम लागत वाला विकल्प है। 1M context window में retrieved सामग्री एक prompt में दें; प्रति 1M tokens $0.12 input / $0.376 output।
RAG के लिए क्यों उपयुक्त है
Retrieved सामग्री को catalog की 1M context सीमा के भीतर रखें। Input की कीमत प्रति 1M tokens $0.12 है। अपने दस्तावेज़ों पर recall जाँचें, खासकर सीमा के पास।
RAG pipeline
प्रासंगिक अंश खोजें, उन्हें prompt में रखें और उनके आधार पर उत्तर माँगें। सामग्री 1M से बड़ी हो तो पहले sections का सारांश बनाएँ।
क्विकस्टार्ट कोड
from openai import OpenAI
client = OpenAI(
base_url="https://api.quicksilverpro.io/v1",
api_key="sk-qsp-...",
)
document = open("annual-report.txt").read()
resp = client.chat.completions.create(
model="qwen3.8-flash-next",
messages=[
{"role": "system", "content": "Answer using only the provided document."},
{"role": "user", "content": f"Document:
{document}
Question: What was free cash flow in Q3?"},
],
max_tokens=500,
)
print(resp.choices[0].message.content)FAQ
1M catalog सीमा है। महत्वपूर्ण retrieval के लिए vector search अपनाएँ और प्रासंगिक अंश पहले रखें।
यह मॉडल non-thinking mode में चलता है। छिपी reasoning trace के लिए बजट रखने की जरूरत नहीं है।
Catalog capabilities: टेक्स्ट इनपुट, टेक्स्ट आउटपुट, स्ट्रीमिंग और टूल कॉलिंग, APIs: Chat Completions और Responses। Production से पहले multi-tool workflows जाँचें।