شروع به کار با هوش مصنوعی Google/Gemini


Google Gemini نسل جدید مدل‌های هوش مصنوعی گوگل است که توسط شرکت DeepMind توسعه یافته و جایگزین مدل‌های قبلی مانند Bard شده است. این مدل با تمرکز بر چندوجهی بودن طراحی شده، به این معنا که می‌تواند به‌صورت هم‌زمان با متن، تصویر، صدا و حتی ویدیو تعامل داشته باشد. Gemini با ادغام قابلیت‌های جستجوی گوگل و فناوری‌های پیشرفته یادگیری عمیق، سعی دارد تجربه‌ای دقیق‌تر، هوشمندتر و منعطف‌تر از هوش مصنوعی را برای کاربران فراهم کند.

در حال حاضر، لیارا، مدل‌های زیر از Google/Gemini را در API خود پشتیبانی می‌کند:

  • مدل google/gemini-2.5-pro-preview
  • مدل google/gemini-2.5-flash
  • مدل google/gemma-3-27b-it
  • مدل google/gemini-2.5-pro
  • مدل google/gemini-embedding-001
  • مدل google/gemini-3-flash-preview
  • مدل google/gemini-2.5-flash-image
  • مدل google/gemini-3-pro-image-preview
  • مدل google/gemini-3.1-pro-preview
  • مدل google/gemini-3.1-pro-preview-customtools
  • مدل google/gemini-embedding-2
  • مدل google/gemini-3.1-flash-lite
  • مدل google/gemini-2.5-flash-lite
  • مدل google/gemini-3.5-flash
  • مدل google/gemini-3.6-flash
  • مدل google/gemini-3.5-flash-lite
  • مدل google/gemini-3.7-flash
  • مدل google/gemini-3.1-flash-tts-preview
  • مدل google/chirp-3
  • مدل google/gemini-3.8-flash
  • مدل google/gemma-4-26b-a4b-it

پس از ایجاد سرویس هوش مصنوعی و دریافت baseUrl و ساخت کلید، می‌توانید از مدل‌های Gemini استفاده کنید.

در قطعه کدهای ارائه‌شده توسط لیارا برای اتصال به مدل، از OpenAI SDK استفاده می‌شود. تمامی مدل‌هایی که لیارا ارائه می‌دهد؛ سازگار با OpenAI SDK هستند.

اتصال به مدل

برای اتصال به مدل در سطح کد، می‌توانید از دو ابزار استفاده کنید:

  • OpenAI SDK: ابزار رسمی ارائه‌شده توسط OpenAI. تمامی مدل‌های ارائه‌شده در لیارا، با این SDK سازگار هستند.
  • AI SDK: ابزار ارائه‌شده توسط Vercel. این SDK، تنها برای جاوااسکریپت و تایپ‌اسکریپت در دسترس است.

در ادامه، نحوه اتصال به مدل، هم با OpenAI SDK و هم با AI SDK، بررسی شده است.

برای اتصال به مدل با OpenAI SDK، می‌توانید از قطعه کدهای زیر، استفاده کنید.

در ابتدا، برای استفاده از مدل هوش مصنوعی مدنظر خود در جاوااسکریپت، باید پکیج openai را نصب کنید. برای این کار، می‌توانید از npm یا yarn استفاده کنید:

کپی
npm install openai # or yarn add openai

سپس، می‌توانید مانند قطعه کد زیر، به مدل هوش مصنوعی خود متصل شوید:

کپی
const OpenAI = require('openai');

const openai = new OpenAI({
baseURL: '<baseUrl>',
apiKey: '<LIARA_API_KEY>',
});

async function main() {
const completion = await openai.chat.completions.create({
  model: '<model_name>',
  messages: [
    {
      role: 'user',
      content: 'Hello!',
    },
  ],
});

console.log(completion.choices[0].message);
}

main();

در قطعه کد‌های فوق، به‌جای <baseUrl>، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای <LIARA_API_TOKEN>، کلید API خود را وارد کنید. همچنین، به‌جای <model_name>، نام یکی از مدل‌های فوق را قرار دهید.

پارامترهای قابل تنظیم

در OpenAI SDK، شما می‌توانید پارامترهای زیر را تنظیم کنید.

در نظر داشته باشید که پارامترهای زیر، ممکن است در برخی از مدل‌ها، پشتیبانی نشوند.

  • frequency_penalty: عددی بین -2 تا 2. کاهش یا افزایش احتمال تکرار کلمات پرتکرار در پاسخ. هرچه بالاتر باشد؛ تنوع بیشتر است
  • logit_bias: تغییر احتمال ظاهر شدن توکن‌های خاص
  • n: تعداد پاسخ‌هایی که قرار است مدل همزمان تولید کند.
  • response_format: مدل را مجبور می‌کند خروجی را به فرمت خاصی برگرداند
  • seed: مقدار عددی ثابت برای شروع تولید تصادفی، در صورت نیاز، به خروجی‌های قابل تکرار
  • stop: آرایه‌ای از رشته‌ها برای اینکه مدل هنگام رسیدن به آن‌ها پاسخ را متوقف کند
  • stream: اگر true باشد، پاسخ مدل به صورت استریم ارسال می‌شود. برای پیاده‌سازی‌های real-time یا رابط کاربری، این حالت مفید است
  • stream_options: تنظیمات مربوط به حالت stream. فقط وقتی استفاده می‌شود که stream: true باشد
  • temperature: عددی بین 0 تا 2. کنترل میزان تصادفی بودن خروجی؛ عدد کمتر، واقع‌گرایی بیشتر و عدد بیشتر، خلاقیت بیشتر
  • tool_choice: تعیین کردن اینکه مدل چه زمانی Tool را فراخوانی کند (به‌صورت هوشمند یا همیشه)
  • tools: مشخص کردن یک‌سری Tool که مدل در صورت نیاز، آن‌ها را فراخوانی کند
  • user: شناسه‌ی کاربر نهایی. برای دسته‌بندی بهتر درخواست‌ها و جلوگیری از سوءاستفاده، به‌کار می‌رود

در ادامه، مثال استفاده از این پارامترها، در زبان‌های مختلف، قرار گرفته است:

کپی
from openai import OpenAI

client = OpenAI(
base_url='<baseUrl>',
api_key='<LIARA_API_KEY>',
)

response = client.chat.completions.create(
  model="<model_name>",
  messages=[
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "write a short article about Machine Learning in json"}
  ],
  frequency_penalty=1.2,
  presence_penalty=1.0,
  temperature=0.8,
  top_p=0.9,
  n=2,
  seed=42,
  stop=["\nUser:", "\nSystem:"],
  logit_bias={"50256": -100}, 
  stream=False,
  stream_options=None,
  response_format={"type": "json_object"},
  tool_choice="auto",
  tools=[
      {
          "type": "function",
          "function": {
              "name": "summarize_text",
              "description": "summarizing a long text",
              "parameters": {
                  "type": "object",
                  "properties": {
                      "text": {"type": "string", "description": "the text should be summarized"}
                  },
                  "required": ["text"]
              }
          }
      }
  ],
)

print(response)

در قطعه کد‌ فوق، به‌جای <baseUrl>، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای <LIARA_API_TOKEN>، کلید API خود را وارد کنید. همچنین، به‌جای <model_name>، نام یکی از مدل‌های فوق را قرار دهید.

اتصال به مدل های تبدیل متن به گفتار (TTS)

برای کار با مدل‌های TTS می‌توانید از ماژول openai استفاده کنید. در ادامه، مثال‌های استفاده از مدل‌های TTS آمده است:

کپی
// npm install openai dotenv

require("dotenv").config();

const fs = require("fs");
const OpenAI = require("openai");

const client = new OpenAI({
apiKey: process.env.LIARA_API_KEY,
baseURL: process.env.BASE_URL,
});

async function main() {
const response = await client.audio.speech.create({
  model: process.env.TTS_MODEL_NAME,
  voice: process.env.TTS_VOICE,
  input: "Hello! This audio was generated using Gemini TTS through Liara.",
  response_format: "pcm",
});

const buffer = Buffer.from(
  await response.arrayBuffer()
);

fs.writeFileSync(
  "speech.pcm",
  buffer
);

console.log("Audio saved to speech.pcm");
}

main().catch(console.error);

پروژه کامل قطعه کد فوق در گیت‌هاب لیارا قابل مشاهده و استفاده است.

در قطعه کدهای فوق، به‌جای BASE_URL، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای LIARA_API_KEY، کلید API خود را وارد کنید. همچنین، به‌جای TTS_MODEL_NAME، نام یکی از مدل‌های TTS و به‌جای TTS_VOICE، نام Voice موردنظر را قرار دهید.

مقادیر قابل استفاده به عنوان متغیر TTS_VOICE

TTS_VOICE یک پارامتر در مدل‌های TTS است که مشخص می‌کند مدل هوش مصنوعی با چه صدای از پیش تعریف‌شده‌ای متن را به گفتار تبدیل کند. هر Voice یک پروفایل صوتی مستقل است که ویژگی‌هایی مثل جنسیت صدا، لحن (Tone)، سرعت، حس بیان (Emotion)، لهجه و سبک صحبت کردن را تعیین می‌کند.

در حال حاضر، می‌توانید مقدار متغیر TTS_VOICE را برای مدل‌های مذکور، با مقادیر زیر پر کنید (بعد از # ‌یک‌سری توضیحات راجع به هر Voice قرار گرفته است).

کپی
TTS_VOICE=Zephyr        # Female - Bright, clear
TTS_VOICE=Puck          # Male - Energetic, youthful
TTS_VOICE=Charon        # Male - Deep, calm
TTS_VOICE=Kore          # Female - Warm, natural
TTS_VOICE=Fenrir        # Male - Strong, expressive
TTS_VOICE=Leda          # Female - Soft, gentle
TTS_VOICE=Orus          # Male - Balanced, conversational
TTS_VOICE=Aoede         # Female - Smooth, expressive
TTS_VOICE=Callirrhoe    # Female - Natural, elegant
TTS_VOICE=Autonoe       # Female - Clear, professional
TTS_VOICE=Enceladus     # Male - Deep, narrator style
TTS_VOICE=Iapetus       # Male - Calm, steady
TTS_VOICE=Umbriel       # Male - Soft, conversational
TTS_VOICE=Algieba       # Male - Warm, friendly
TTS_VOICE=Despina       # Female - Clear, natural
TTS_VOICE=Erinome       # Female - Gentle, calm
TTS_VOICE=Algenib       # Male - Deep, authoritative
TTS_VOICE=Rasalgethi    # Male - Expressive, dramatic
TTS_VOICE=Laomedeia     # Female - Bright, engaging
TTS_VOICE=Achernar      # Female - Smooth, natural
TTS_VOICE=Alnilam       # Male - Professional
TTS_VOICE=Schedar       # Female - Warm, conversational
TTS_VOICE=Gacrux        # Female - Soft, emotional
TTS_VOICE=Pulcherrima   # Female - Elegant
TTS_VOICE=Achird        # Male - Natural, balanced
TTS_VOICE=Zubenelgenubi  # Male - Deep, formal
TTS_VOICE=Vindemiatrix  # Female - Calm, clear
TTS_VOICE=Sadachbia     # Male - Friendly
TTS_VOICE=Sadaltager    # Male - Narration style
TTS_VOICE=Sulafat       # Female - Expressive

تبدیل فایل‌های با فرمت PCM به MP3

از آنجایی که تنها فرمت خروجی مدل‌های مذکور Gemini، تنها pcm است؛ بنابراین برای تبدیل این فرمت به فرمت‌های رایج‌تر مانند mp3، می‌توانید از ffmpeg استفاده کنید. به عنوان مثال:

کپی
// npm install fluent-ffmpeg

const fs = require("fs");
const ffmpeg = require("fluent-ffmpeg");

function pcmToMp3(inputFile, outputFile) {
return new Promise((resolve, reject) => {
  ffmpeg()
    .input(inputFile)
    .inputFormat("s16le")
    .inputOptions([
      "-ar 24000",
      "-ac 1"
    ])
    .audioFilters("loudnorm=I=-16:TP=-1.5:LRA=11")
    .audioCodec("libmp3lame")
    .audioBitrate("192k")
    .output(outputFile)
    .on("end", resolve)
    .on("error", reject)
    .run();
});
}

pcmToMp3(
"speech.pcm",
"speech.mp3"
);

اتصال به مدل های تبدیل گفتار به متن (STT)

برای کار با مدل‌های TTS می‌توانید از ماژول openai استفاده کنید. در ادامه، مثال‌های استفاده از مدل‌های TTS آمده است:

کپی
// npm install openai dotenv

require("dotenv").config();

const fs = require("fs");
const path = require("path");
const OpenAI = require("openai");
const { toFile } = require("openai");

const client = new OpenAI({
apiKey: process.env.LIARA_API_KEY,
baseURL: process.env.BASE_URL,
});

async function main() {
const audioPath = path.resolve(process.env.AUDIO_FILE);

if (!fs.existsSync(audioPath)) {
  throw new Error(`Audio file not found: ${audioPath}`);
}

const extension = path.extname(audioPath).toLowerCase();

const mimeTypes = {
  ".mp3": "audio/mpeg",
  ".wav": "audio/wav",
  ".flac": "audio/flac",
  ".m4a": "audio/mp4",
  ".ogg": "audio/ogg",
  ".webm": "audio/webm",
  ".aac": "audio/aac",
};

const mimeType = mimeTypes[extension];

if (!mimeType) {
  throw new Error(`Unsupported audio format: ${extension}`);
}

const audioBuffer = fs.readFileSync(audioPath);

const audioFile = await toFile(
  audioBuffer,
  path.basename(audioPath),
  {
    type: mimeType,
  }
);

const transcription = await client.audio.transcriptions.create({
  model: process.env.STT_MODEL_NAME,
  file: audioFile,
});

console.log(transcription.text);
}

main().catch(console.error);

پروژه کامل قطعه کد فوق در گیت‌هاب لیارا قابل مشاهده و استفاده است.

در قطعه کدهای فوق، به‌جای BASE_URL، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای LIARA_API_KEY، کلید API خود را وارد کنید. همچنین، به‌جای STT_MODEL_NAME، نام مدل STT و به‌جای AUDIO_FILE، نام یا مسیر فایل صوتی موردنظر برای تبدیل گفتار به متن را قرار دهید.