شروع به کار با هوش مصنوعی Sesame
Sesame یک شرکت فعال در حوزه هوش مصنوعی صوتی و Agentهای مکالمهای است که تمرکز آن بر ایجاد تعامل صوتی طبیعی، دارای ریتم، لحن و آگاهی از زمینه مکالمه است.
در حال حاضر، لیارا، مدلهای زیر از Sesame را در API خود پشتیبانی میکند:
- مدل sesame/csm-1b
پس از ایجاد سرویس هوش مصنوعی و دریافت baseUrl و ساخت کلید، میتوانید از مدلهای Sesame استفاده کنید.
اتصال به مدل های تبدیل متن به گفتار (TTS)
برای کار با مدلهای TTS میتوانید از ماژول openai استفاده کنید. در ادامه، مثالهای استفاده از مدلهای TTS آمده است:
پروژه کامل قطعه کد فوق در گیتهاب لیارا قابل مشاهده و استفاده است.
در قطعه کدهای فوق، بهجای BASE_URL، آدرس سرویس هوش مصنوعی خود را قرار دهید و بهجای LIARA_API_KEY، کلید API خود را وارد کنید. همچنین، بهجای TTS_MODEL_NAME، نام یکی از مدلهای TTS و بهجای TTS_VOICE، نام Voice موردنظر را قرار دهید.
مقادیر قابل استفاده به عنوان متغیر TTS_VOICE
TTS_VOICE یک پارامتر در مدلهای TTS است که مشخص میکند مدل هوش مصنوعی با چه صدای از پیش تعریفشدهای متن را به گفتار تبدیل کند. هر Voice یک پروفایل صوتی مستقل است که ویژگیهایی مثل جنسیت صدا، لحن (Tone)، سرعت، حس بیان (Emotion)، لهجه و سبک صحبت کردن را تعیین میکند.
در حال حاضر، میتوانید مقدار متغیر TTS_VOICE را برای مدلهای مذکور، با مقادیر زیر پر کنید (بعد از # یکسری توضیحات راجع به هر Voice قرار گرفته است).



