Qwen3-VL-8B-Thinking — это оптимизированный для рассуждений вариант мультимодальной модели Qwen3-VL-8B, предназначенный для продвинутого визуального и текстового анализа сложных сцен, документов и временных последовательностей. Он интегрирует улучшенное мультимодальное выравнивание и обработку длинного контекста (нативно 256K, с возможностью расширения до 1 млн токенов) для таких задач, как научный визуальный анализ, причинно-следственные выводы и математические рассуждения на основе изображений или видео. По сравнению с версией Instruct, версия Thinking представляет собой более глубокую визуально-языковую интеграцию и целенаправленные пути рассуждений, которые повышают производительность в задачах логических цепочек, решении STEM-задач и многоэтапном понимании видео. Он достигает более сильного темпорального заземления через Interleaved-MRoPE и вложения с учетом временных меток, сохраняя при этом надежное оптическое распознавание символов (OCR), многоязычное понимание и генерацию текста на уровне больших LLM, ориентированных только на текст.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegerstopstring | string[]frequency_penaltynumberpresence_penaltynumberseedintegerlogprobsbooleantop_logprobsintegerresponse_formatstructured_outputsbooleantoolsarraytool_choicestring | objectreasoningobjectinclude_reasoningboolean