*Ling-3.0-flash* — это *модель Mixture-of-Experts (MoE) с 124 миллиардами параметров*, с приблизительно *5,1 миллиардами активных параметров на токен*. Модель разработана с приоритетом на *эффективность токенов и инференс агентных систем в производственном масштабе*, что позволяет разработчикам выполнять больше полезной работы в рамках ограниченных бюджетов по токенам, задержкам и затратам на обслуживание.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="inclusionai/ling-3.0-flash:free",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegerstopstring | string[]frequency_penaltynumberpresence_penaltynumberrepetition_penaltynumberseedintegerlogprobsbooleantop_logprobsintegertoolsarraytool_choicestring | objectreasoningobjectinclude_reasoningboolean