شروع به کار با هوش مصنوعی NVIDIA


NVIDIA یکی از شرکت‌های پیشرو در حوزه پردازش شتاب‌یافته (Accelerated Computing) و هوش مصنوعی است که علاوه بر تولید GPUهای مورد استفاده در آموزش و اجرای مدل‌های بزرگ، مجموعه‌ای از مدل‌ها و پلتفرم‌های هوش مصنوعی را نیز توسعه می‌دهد. مدل‌های NVIDIA در حوزه‌هایی مانند پردازش زبان طبیعی (NLP)، تشخیص و تولید گفتار، بینایی کامپیوتر، هوش مصنوعی مولد (Generative AI) و رباتیک کاربرد دارند.

در حال حاضر، لیارا، مدل‌های زیر از NVIDIA را در API خود پشتیبانی می‌کند:

  • مدل nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b

پس از ایجاد سرویس هوش مصنوعی و دریافت baseUrl و ساخت کلید، می‌توانید از مدل‌های Nvidia استفاده کنید.

اتصال به مدل های تبدیل گفتار به متن (STT)

برای کار با مدل‌های STT می‌توانید از ماژول openai استفاده کنید. در ادامه، مثال‌های استفاده از مدل‌های STT آمده است:

کپی
// npm install openai dotenv

require("dotenv").config();

const fs = require("fs");
const path = require("path");
const OpenAI = require("openai");
const { toFile } = require("openai");

const client = new OpenAI({
apiKey: process.env.LIARA_API_KEY,
baseURL: process.env.BASE_URL,
});

async function main() {
const audioPath = path.resolve(process.env.AUDIO_FILE);

if (!fs.existsSync(audioPath)) {
  throw new Error(`Audio file not found: ${audioPath}`);
}

const extension = path.extname(audioPath).toLowerCase();

const mimeTypes = {
  ".mp3": "audio/mpeg",
  ".wav": "audio/wav",
  ".flac": "audio/flac",
  ".m4a": "audio/mp4",
  ".ogg": "audio/ogg",
  ".webm": "audio/webm",
  ".aac": "audio/aac",
};

const mimeType = mimeTypes[extension];

if (!mimeType) {
  throw new Error(`Unsupported audio format: ${extension}`);
}

const audioBuffer = fs.readFileSync(audioPath);

const audioFile = await toFile(
  audioBuffer,
  path.basename(audioPath),
  {
    type: mimeType,
  }
);

const transcription = await client.audio.transcriptions.create({
  model: process.env.STT_MODEL_NAME,
  file: audioFile,
});

console.log(transcription.text);
}

main().catch(console.error);

پروژه کامل قطعه کد فوق در گیت‌هاب لیارا قابل مشاهده و استفاده است.

در قطعه کدهای فوق، به‌جای BASE_URL، آدرس سرویس هوش مصنوعی خود را قرار دهید و به‌جای LIARA_API_KEY، کلید API خود را وارد کنید. همچنین، به‌جای STT_MODEL_NAME، نام مدل STT و به‌جای AUDIO_FILE، نام یا مسیر فایل صوتی موردنظر برای تبدیل گفتار به متن را قرار دهید.