Qwen3.8 Flash Next для длинного контекста
Qwen3.8 Flash Next — быстрый и недорогой выбор для поиска и длинных документов. Контекст 1M позволяет включить найденные материалы в один запрос: $0.12 за вход / $0.376 за выход на 1M токенов.
Почему подходит для RAG
Размер найденных материалов ограничен контекстом 1M. Вход стоит $0.12 за 1M токенов. Проверяйте качество поиска на своих документах, особенно у предела контекста.
Схема RAG
Найдите релевантные фрагменты, включите их в запрос и попросите ответ на их основе. Если корпус превышает 1M, сначала суммаризируйте разделы.
Код для быстрого старта
from openai import OpenAI
client = OpenAI(
base_url="https://api.quicksilverpro.io/v1",
api_key="sk-qsp-...",
)
document = open("annual-report.txt").read()
resp = client.chat.completions.create(
model="qwen3.8-flash-next",
messages=[
{"role": "system", "content": "Answer using only the provided document."},
{"role": "user", "content": f"Document:
{document}
Question: What was free cash flow in Q3?"},
],
max_tokens=500,
)
print(resp.choices[0].message.content)FAQ
1M — лимит каталога. Для критичного поиска используйте векторный поиск и помещайте релевантные фрагменты первыми.
Модель работает без режима рассуждений. Не нужно закладывать бюджет на скрытый reasoning trace.
Возможности каталога: текстовый ввод, текстовый вывод, стриминг и вызов инструментов, API: Chat Completions и Responses. Проверяйте цепочки инструментов перед запуском в production.