Qwen3-VL-8B-Instruct — это мультимодальная модель с видением и языком из серии Qwen3-VL, разработанная для высокоточного понимания и рассуждений в тексте, изображениях и видео. Она отличается улучшенной мультимодальной агломерацией с Interleaved-MRoPE для долгосрочного темпорального рассуждения, DeepStack для детального согласования визуального и текстового материала, а также согласованием текста и временных меток для точной локализации событий. Модель поддерживает собственное контекстное окно на 256 тыс. токенов, расширяемое до 1 млн токенов, и обрабатывает как статические, так и динамические медиавходы для таких задач, как парсинг документов, ответы на визуальные вопросы, пространственное рассуждение и управление графическим интерфейсом. Она обеспечивает понимание текста, сопоставимое с ведущими LLM, при этом расширяя охват OCR до 32 языков и повышая устойчивость в различных визуальных условиях.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="qwen/qwen3-vl-8b-instruct",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegerstopstring | string[]frequency_penaltynumberpresence_penaltynumberrepetition_penaltynumberseedintegerlogit_biasobjectlogprobsbooleantop_logprobsintegerresponse_formatobjectstructured_outputsbooleantoolsarraytool_choicestring | object