شروع به کار با هوش مصنوعی Sesame


Sesame یک شرکت فعال در حوزه هوش مصنوعی صوتی و Agentهای مکالمه‌ای است که تمرکز آن بر ایجاد تعامل صوتی طبیعی، دارای ریتم، لحن و آگاهی از زمینه مکالمه است.

در حال حاضر، لیارا، مدل‌های زیر از Sesame را در API خود پشتیبانی می‌کند:

  • مدل sesame/csm-1b

پس از ایجاد سرویس هوش مصنوعی و دریافت baseUrl و ساخت کلید، می‌توانید از مدل‌های Sesame استفاده کنید.

اتصال به مدل های تبدیل متن به گفتار (TTS)

برای کار با مدل‌های TTS می‌توانید از ماژول openai استفاده کنید. در ادامه، مثال‌های استفاده از مدل‌های TTS آمده است:

کپی
// npm install openai dotenv
require("dotenv").config();

const fs = require("fs");
const OpenAI = require("openai");

const client = new OpenAI({
apiKey: process.env.LIARA_API_KEY,
baseURL: process.env.BASE_URL,
});

async function main() {
const response = await client.audio.speech.create({
  model: process.env.TTS_MODEL_NAME,
  voice: process.env.TTS_VOICE,
  input: "Hello! This audio was generated using Sesame MAI Voice through Liara.",
  response_format: "mp3",
});

const buffer = Buffer.from(await response.arrayBuffer());

fs.writeFileSync("speech.mp3", buffer);

console.log("Audio saved to speech.mp3");
}

main().catch(console.error);

پروژه کامل قطعه کد فوق در گیت‌هاب لیارا قابل مشاهده و استفاده است.

در قطعه کدهای فوق، به‌جای BASE_URL، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای LIARA_API_KEY، کلید API خود را وارد کنید. همچنین، به‌جای TTS_MODEL_NAME، نام یکی از مدل‌های TTS و به‌جای TTS_VOICE، نام Voice موردنظر را قرار دهید.