Главная/Сценарии/qwen3 для long-context
Сценарий

Qwen3.8 Flash Next для длинного контекста

Qwen3.8 Flash Next — быстрый и недорогой выбор для поиска и длинных документов. Контекст 1M позволяет включить найденные материалы в один запрос: $0.12 за вход / $0.376 за выход на 1M токенов.

$0.12 / $0.376 per 1M tokens

Почему подходит для RAG

Размер найденных материалов ограничен контекстом 1M. Вход стоит $0.12 за 1M токенов. Проверяйте качество поиска на своих документах, особенно у предела контекста.

Схема RAG

Найдите релевантные фрагменты, включите их в запрос и попросите ответ на их основе. Если корпус превышает 1M, сначала суммаризируйте разделы.

Код для быстрого старта

python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.quicksilverpro.io/v1",
    api_key="sk-qsp-...",
)

document = open("annual-report.txt").read()

resp = client.chat.completions.create(
    model="qwen3.8-flash-next",
    messages=[
        {"role": "system", "content": "Answer using only the provided document."},
        {"role": "user", "content": f"Document:
{document}

Question: What was free cash flow in Q3?"},
    ],
    max_tokens=500,
)
print(resp.choices[0].message.content)

FAQ

1M — лимит каталога. Для критичного поиска используйте векторный поиск и помещайте релевантные фрагменты первыми.

Модель работает без режима рассуждений. Не нужно закладывать бюджет на скрытый reasoning trace.

Возможности каталога: текстовый ввод, текстовый вывод, стриминг и вызов инструментов, API: Chat Completions и Responses. Проверяйте цепочки инструментов перед запуском в production.

Начните со своим ключом

Получить API-ключ