*Ling-3.0-flash* — это *модель Mixture-of-Experts (MoE) с 124 миллиардами параметров*, в которой для каждого токена активируется приблизительно *5,1 миллиарда параметров*. Модель разработана с учетом таких ключевых приоритетов, как *эффективность использования токенов и вывод на уровне продакшена для агентов*, что позволяет разработчикам выполнять больше полезной работы в рамках ограниченных бюджетов на токены, задержку и затраты на обслуживание.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="inclusionai/ling-3.0-flash",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegermin_pnumberstopstring | string[]frequency_penaltynumberpresence_penaltynumberrepetition_penaltynumberseedintegerlogit_biasobjectlogprobsbooleantop_logprobsintegerresponse_formatobjecttoolsarraytool_choicestring | objectreasoningobjectinclude_reasoningboolean