Mercury 2.5 — это самая быстрая модель LLM с функциями рассуждения, а также последняя модель dLLM (diffusion LLM) от Inception. Вместо последовательной генерации токенов, Mercury 2.5 создает и улучшает несколько токенов параллельно, достигая 1107 токенов/сек на стандартных GPU. Она обеспечивает улучшение интеллекта более чем на 10 пунктов по сравнению с Mercury 2, сравнимое по качеству с оптимизированными по стоимости передовыми моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5. Mercury 2.5 поддерживает настраиваемые уровни рассуждения, параллельные вызовы инструментов и вывод JSON, соответствующий схеме. Она создана для производственных нагрузок, где задержки накапливаются: агенты поиска, голосовые конвейеры и под-агенты для написания кода. Подробнее читайте в [блоге](https://www.inceptionlabs.ai/blog/introducing-mercury-2-5).
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="inception/mercury-2.5",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegerstopstring | string[]response_formatobjectstructured_outputsbooleantoolsarraytool_choicestring | objectreasoningobjectreasoning_effortstringinclude_reasoningboolean