उपयोग मामला

लंबे context के लिए Qwen3.8 Flash Next

Qwen3.8 Flash Next retrieval और लंबे दस्तावेज़ों के लिए तेज़ और कम लागत वाला विकल्प है। 1M context window में retrieved सामग्री एक prompt में दें; प्रति 1M tokens $0.12 input / $0.376 output।

$0.12 / $0.376 per 1M tokens

RAG के लिए क्यों उपयुक्त है

Retrieved सामग्री को catalog की 1M context सीमा के भीतर रखें। Input की कीमत प्रति 1M tokens $0.12 है। अपने दस्तावेज़ों पर recall जाँचें, खासकर सीमा के पास।

RAG pipeline

प्रासंगिक अंश खोजें, उन्हें prompt में रखें और उनके आधार पर उत्तर माँगें। सामग्री 1M से बड़ी हो तो पहले sections का सारांश बनाएँ।

क्विकस्टार्ट कोड

python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.quicksilverpro.io/v1",
    api_key="sk-qsp-...",
)

document = open("annual-report.txt").read()

resp = client.chat.completions.create(
    model="qwen3.8-flash-next",
    messages=[
        {"role": "system", "content": "Answer using only the provided document."},
        {"role": "user", "content": f"Document:
{document}

Question: What was free cash flow in Q3?"},
    ],
    max_tokens=500,
)
print(resp.choices[0].message.content)

FAQ

1M catalog सीमा है। महत्वपूर्ण retrieval के लिए vector search अपनाएँ और प्रासंगिक अंश पहले रखें।

यह मॉडल non-thinking mode में चलता है। छिपी reasoning trace के लिए बजट रखने की जरूरत नहीं है।

Catalog capabilities: टेक्स्ट इनपुट, टेक्स्ट आउटपुट, स्ट्रीमिंग और टूल कॉलिंग, APIs: Chat Completions और Responses। Production से पहले multi-tool workflows जाँचें।

अपनी key के साथ शुरू करें

API Key लें