NVIDIA Nemotron Nano 2 VL — это открытая мультимодальная модель для рассуждений с 12 миллиардами параметров, предназначенная для анализа видео и работы с документами. Она представляет гибридную архитектуру Transformer-Mamba, сочетающую точность уровня Transformer с эффективным моделированием последовательностей Mamba для значительно более высокой пропускной способности и низкой задержки. Модель поддерживает ввод текста и многостраничных документов, генерируя выходные данные на естественном языке. Она обучена на высококачественных синтетических наборах данных, отобранных NVIDIA и оптимизированных для оптического распознавания символов, анализа диаграмм и мультимодального понимания. Nemotron Nano 2 VL показывает передовые результаты в OCRBench v2 и набирает в среднем ≈74 балла по MMMU, MathVista, AI2D, OCRBench, OCR-Reasoning, ChartQA, DocVQA и Video-MME, превосходя предыдущие открытые базовые модели VL. С помощью Efficient Video Sampling (EVS) модель обрабатывает длинные видео, снижая при этом стоимость вывода. Открытые веса, обучающие данные и рецепты для дообучения выпущены под разрешительной открытой лицензией NVIDIA, с поддержкой развертывания через NeMo, NIM и основные среды выполнения.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="nvidia/nemotron-nano-12b-v2-vl:free",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumberseedintegertoolsarraytool_choicestring | objectreasoningobjectinclude_reasoningboolean