Gemma 3n E4B — оптимизирована для эффективного выполнения на мобильных устройствах и устройствах с ограниченными ресурсами, таких как телефоны, ноутбуки и планшеты. Она поддерживает мультимодальные входные данные, включая текст, визуальные данные и аудио, что позволяет выполнять различные задачи, такие как генерация текста, распознавание речи, перевод и анализ изображений. Используя такие инновации, как кэширование встраиваний по слоям (PLE) и архитектура MatFormer, Gemma 3n динамически управляет использованием памяти и вычислительной нагрузкой, выборочно активируя параметры модели, что значительно снижает требования к ресурсам во время выполнения. Эта модель поддерживает широкий языковой диапазон (обучена более чем на 140 языках) и оснащена гибким контекстным окном в 32K токенов. Gemma 3n может выборочно загружать параметры, оптимизируя эффективность использования памяти и вычислений в зависимости от задачи или возможностей устройства, что делает ее хорошо подходящей для приложений, ориентированных на конфиденциальность, работающих в автономном режиме, и решений для ИИ на устройстве. [Подробнее в статье в блоге](https://developers.googleblog.com/en/introducing-gemma-3n/)
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="google/gemma-3n-e4b-it",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegermin_pnumberstopstring | string[]frequency_penaltynumberpresence_penaltynumberrepetition_penaltynumberlogit_biasobjectresponse_formatstructured_outputsboolean