شروع به کار با هوش مصنوعی MiniMax


MiniMax یک پلتفرم و پیشرو در توسعه مدل‌های بنیادین هوش مصنوعی است که هدفش پیشبرد مرزهای هوش مصنوعی عمومی (AGI) و ارائه قابلیت‌های هوشمند در گستره‌ای از داده‌ها است.

در حال حاضر، لیارا، مدل زیر از MiniMax را در API خود پشتیبانی می‌کند:

  • مدل minimax/minimax-m2.5
  • مدل minimax/minimax-m3
  • مدل minimax/speech-2.8-turbo
  • مدل minimax/speech-2.8-hd

پس از ایجاد سرویس هوش مصنوعی و دریافت baseUrl و ساخت کلید، می‌توانید از مدل‌های MiniMax استفاده کنید.

در قطعه کدهای ارائه‌شده توسط لیارا برای اتصال به مدل، از OpenAI SDK استفاده می‌شود. تمامی مدل‌هایی که لیارا ارائه می‌دهد؛ سازگار با OpenAI SDK هستند.

اتصال به مدل

برای اتصال به مدل در سطح کد، می‌توانید از دو ابزار استفاده کنید:

  • OpenAI SDK: ابزار رسمی ارائه‌شده توسط OpenAI. تمامی مدل‌های ارائه‌شده در لیارا، با این SDK سازگار هستند.
  • AI SDK: ابزار ارائه‌شده توسط Vercel. این SDK، تنها برای جاوااسکریپت و تایپ‌اسکریپت در دسترس است.

در ادامه، نحوه اتصال به مدل، هم با OpenAI SDK و هم با AI SDK، بررسی شده است.

برای اتصال به مدل با OpenAI SDK، می‌توانید از قطعه کدهای زیر، استفاده کنید.

در ابتدا، برای استفاده از مدل هوش مصنوعی مدنظر خود در جاوااسکریپت، باید پکیج openai را نصب کنید. برای این کار، می‌توانید از npm یا yarn استفاده کنید:

کپی
npm install openai # or yarn add openai

سپس، می‌توانید مانند قطعه کد زیر، به مدل هوش مصنوعی خود متصل شوید:

کپی
const OpenAI = require('openai');

const openai = new OpenAI({
baseURL: '<baseUrl>',
apiKey: '<LIARA_API_KEY>',
});

async function main() {
const completion = await openai.chat.completions.create({
  model: '<model_name>',
  messages: [
    {
      role: 'user',
      content: 'Hello!',
    },
  ],
});

console.log(completion.choices[0].message);
}

main();

در قطعه کد‌های فوق، به‌جای <baseUrl>، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای <LIARA_API_TOKEN>، کلید API خود را وارد کنید. همچنین، به‌جای <model_name>، نام یکی از مدل‌های فوق را قرار دهید.

پارامترهای قابل تنظیم

در OpenAI SDK، شما می‌توانید پارامترهای زیر را تنظیم کنید.

در نظر داشته باشید که پارامترهای زیر، ممکن است در برخی از مدل‌ها، پشتیبانی نشوند.

  • frequency_penalty: عددی بین -2 تا 2. کاهش یا افزایش احتمال تکرار کلمات پرتکرار در پاسخ. هرچه بالاتر باشد؛ تنوع بیشتر است
  • logit_bias: تغییر احتمال ظاهر شدن توکن‌های خاص
  • n: تعداد پاسخ‌هایی که قرار است مدل همزمان تولید کند.
  • response_format: مدل را مجبور می‌کند خروجی را به فرمت خاصی برگرداند
  • seed: مقدار عددی ثابت برای شروع تولید تصادفی، در صورت نیاز، به خروجی‌های قابل تکرار
  • stop: آرایه‌ای از رشته‌ها برای اینکه مدل هنگام رسیدن به آن‌ها پاسخ را متوقف کند
  • stream: اگر true باشد، پاسخ مدل به صورت استریم ارسال می‌شود. برای پیاده‌سازی‌های real-time یا رابط کاربری، این حالت مفید است
  • stream_options: تنظیمات مربوط به حالت stream. فقط وقتی استفاده می‌شود که stream: true باشد
  • temperature: عددی بین 0 تا 2. کنترل میزان تصادفی بودن خروجی؛ عدد کمتر، واقع‌گرایی بیشتر و عدد بیشتر، خلاقیت بیشتر
  • tool_choice: تعیین کردن اینکه مدل چه زمانی Tool را فراخوانی کند (به‌صورت هوشمند یا همیشه)
  • tools: مشخص کردن یک‌سری Tool که مدل در صورت نیاز، آن‌ها را فراخوانی کند
  • user: شناسه‌ی کاربر نهایی. برای دسته‌بندی بهتر درخواست‌ها و جلوگیری از سوءاستفاده، به‌کار می‌رود

در ادامه، مثال استفاده از این پارامترها، در زبان‌های مختلف، قرار گرفته است:

کپی
from openai import OpenAI

client = OpenAI(
base_url='<baseUrl>',
api_key='<LIARA_API_KEY>',
)

response = client.chat.completions.create(
  model="<model_name>",
  messages=[
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "write a short article about Machine Learning in json"}
  ],
  frequency_penalty=1.2,
  presence_penalty=1.0,
  temperature=0.8,
  top_p=0.9,
  n=2,
  seed=42,
  stop=["\nUser:", "\nSystem:"],
  logit_bias={"50256": -100}, 
  stream=False,
  stream_options=None,
  response_format={"type": "json_object"},
  tool_choice="auto",
  tools=[
      {
          "type": "function",
          "function": {
              "name": "summarize_text",
              "description": "summarizing a long text",
              "parameters": {
                  "type": "object",
                  "properties": {
                      "text": {"type": "string", "description": "the text should be summarized"}
                  },
                  "required": ["text"]
              }
          }
      }
  ],
)

print(response)

در قطعه کد‌ فوق، به‌جای <baseUrl>، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای <LIARA_API_TOKEN>، کلید API خود را وارد کنید. همچنین، به‌جای <model_name>، نام یکی از مدل‌های فوق را قرار دهید.

اتصال به مدل های تبدیل متن به گفتار (TTS)

برای کار با مدل‌های TTS می‌توانید از ماژول openai استفاده کنید. در ادامه، مثال‌های استفاده از مدل‌های TTS آمده است:

کپی
// npm install openai dotenv
require("dotenv").config();

const fs = require("fs");
const OpenAI = require("openai");

const client = new OpenAI({
apiKey: process.env.LIARA_API_KEY,
baseURL: process.env.BASE_URL,
});

async function main() {
const response = await client.audio.speech.create({
  model: process.env.TTS_MODEL_NAME,
  voice: process.env.TTS_VOICE,
  input: "Hello! This audio was generated using Microsoft MAI Voice through Liara.",
  response_format: "mp3",
});

const buffer = Buffer.from(await response.arrayBuffer());

fs.writeFileSync("speech.mp3", buffer);

console.log("Audio saved to speech.mp3");
}

main().catch(console.error);

پروژه کامل قطعه کد فوق در گیت‌هاب لیارا قابل مشاهده و استفاده است.

در قطعه کدهای فوق، به‌جای BASE_URL، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای LIARA_API_KEY، کلید API خود را وارد کنید. همچنین، به‌جای TTS_MODEL_NAME، نام یکی از مدل‌های TTS و به‌جای TTS_VOICE، نام Voice موردنظر را قرار دهید.

مقادیر قابل استفاده به عنوان متغیر TTS_VOICE

TTS_VOICE یک پارامتر در مدل‌های TTS است که مشخص می‌کند مدل هوش مصنوعی با چه صدای از پیش تعریف‌شده‌ای متن را به گفتار تبدیل کند. هر Voice یک پروفایل صوتی مستقل است که ویژگی‌هایی مثل جنسیت صدا، لحن (Tone)، سرعت، حس بیان (Emotion)، لهجه و سبک صحبت کردن را تعیین می‌کند.

در حال حاضر، می‌توانید مقدار متغیر TTS_VOICE را برای مدل‌های مذکور، با مقادیر زیر پر کنید (بعد از # ‌یک‌سری توضیحات راجع به هر Voice قرار گرفته است).

کپی
TTS_VOICE=English_Graceful_Lady
# Female - Graceful, gentle and natural - English

TTS_VOICE=English_Insightful_Speaker
# Male - Clear, thoughtful and professional - English

TTS_VOICE=English_radiant_girl
# Female - Bright, youthful and energetic - English

TTS_VOICE=English_Persuasive_Man
# Male - Confident and persuasive - English

TTS_VOICE=English_ReservedYoungMan
# Male - Calm, restrained and youthful - English

TTS_VOICE=English_PlayfulGirl
# Female - Playful, lively and youthful - English

TTS_VOICE=English_CalmWoman
# Female - Calm, soft and composed - English

TTS_VOICE=English_Gentle-voiced_man
# Male - Gentle, warm and relaxed - English

TTS_VOICE=English_Upbeat_Woman
# Female - Upbeat, energetic and friendly - English

TTS_VOICE=English_Whispering_girl
# Female - Soft and whisper-like - English

TTS_VOICE=English_Diligent_Man
# Male - Steady, serious and professional - English

TTS_VOICE=English_StressedLady
# Female - Tense and emotionally stressed - English

TTS_VOICE=English_AssertiveQueen
# Female - Strong, assertive and authoritative - English

TTS_VOICE=English_AnimeCharacter
# Female - Animated, expressive character voice - English

TTS_VOICE=English_ConfidentWoman
# Female - Confident, clear and professional - English

TTS_VOICE=English_Deep-VoicedGentleman
# Male - Deep, mature and composed - English

TTS_VOICE=English_Wiselady
# Female - Mature, calm and thoughtful - English

TTS_VOICE=English_SentimentalLady
# Female - Emotional, gentle and sentimental - English

TTS_VOICE=English_SadTeen
# Young - Sad and emotional - English

TTS_VOICE=English_ImposingManner
# Male - Strong, imposing and authoritative - English

TTS_VOICE=English_ExuberantGirl
# Female - Highly energetic and expressive - English