رونمایی متا از هوش مصنوعی Spirit LM مدلی برای تولید مکالمات صوتی

متا از هوش مصنوعی Spirit LM رونمایی کرد

فهرست مطالب

شرکت «متا» از مدل «Spirit LM» به عنوان نخستین هوش مصنوعی چند وجهی خود رونمایی کرد که متن و صورت را در ورودی و خروجی با هم ترکیب می‌کند. این مدل با بهره‌گیری از روشی نوآورانه صدا را با لحن و بیان بسیار طبیعی‌ تولید کرده و از این نظر مدل‌های چندوجهی GPT-4o و Hume EVI 2 را به چالش می کشد.

هوش مصنوعی Spirit LM که توسط تیم «تحقیقات بنیادی هوش مصنوعی متا» (FAIR) طراحی شده، تجربه کاربری از مکالمه صوتی با هوش مصنوعی و گفتار و بیان آن را به سطح جدیدی ارتقا می‌دهد. در ویدیوهای نمونه صدا و لحن مدل به حدی طبیعی است که تشخیص آن از انسان ناممکن خواهد بود. 

این مدل همچنین مهارت‌های خود را در حوزه‌های مختلف مانند تشخیص خودکار گفتار (ASR)، تبدیل متن به گفتار (TTS) و طبقه‌بندی گفتار بهبود می‌بخشد. 

متا از هوش مصنوعی Spirit LM رونمایی کرد

رویکرد جدید در تبدیل متن به صوت

مدل‌های سنتی برای پردازش ورودی صوتی از تشخیص خودکار گفتار بهره می‌برند که طی آن ورودی صوتی به متن تبدیل شده و پس از پردازش توسط ماشین دوباره به صوت تبدیل می‌شود. 

این روش با وجود کارآمدی  ویژگی‌های انسانی صدا از جمله لحن و احساس را از بین می‌برد. مدل Spirit LM برای غلبه بر این محدودیت از روشی جدید بهره می‌برد که گام، آهنگ و لحن صدا را به خوبی حفظ می‌کند. 

 

مدل جدید متا در دو نسخه معرفی شده است:

  • Spirit LM Base: از توکن‌های آوایی برای پردازش و تولید صدا استفاده می‌کند.
  • Spirit LM Expressive: شامل توکن‌های بیشتری است که جنبه‌های احساسی مثل غم و هیجان را در صدای ورودی شناسایی کرده و در خروجی منعکس می‌کند.

 

هر دو مدل روی ترکیبی از داده‌های متنی و صوتی آموزش دیده‌اند که به Spirit LM امکان می‌دهد وظایف چندوجهی مانند تبدیل متن به صوت و صوت به متن را انجام داده و درعین‌حال بیان طبیعی را در خروجی‌ها حفظ کند.

کاربردها و پتانسیل‌های مدل 

هوش مصنوعی یا مدل Spirit LM به شکلی طراحی شده که توان یادگیری وظایف چندوجهی جدید را دارد:

  • تشخیص گفتار خودکار: فرایند ASR که در آن سیگنال‌های صوتی به متن تبدیل می‌شوند.
  • تبدیل متن به صوت: فرایند TTS که در آن متن ورودی به سیگنال‌های صوتی تبدیل می‌شود.
  • طبقه‌بندی گفتار: شناسایی و دسته‌بندی صدا بر اساس محتوا، لحن، گوینده یا زبان.

 

نسخه Spirit LM Expressive با تشخیص احساساتی مثل غم، خشم یا تعجب در صدای ورودی یک گام فراتر می‌رود. برای مثال اگر صدای ورودی غمگین باشد آن را تشخیص داده و خروجی را با همان لحن ارائه می‌کند. توسعه چنین مدلی در مواردی مثل بات پشتیبان و دستیار مجازی که تعامل انسانی در آنها مهم است، یک پیشرفت قابل‌توجه به شمار می‌رود. 

متا از هوش مصنوعی Spirit LM رونمایی کرد

متن‌باز و غیرتجاری

متا مدل زبانی Spirit LM را به طور کامل متن‌باز کرده که در راستای تعهد این شرکت به جامعه علمی آزاد قرار دارد. این شرکت ویژگی‌های فنی مدل از جمله وزن، کد و مستندات آن را در اختیار محققان و توسعه‌دهندگان قرار داده تا آنها را به یافتن روش‌های جدید برای تلفیق گفتار و متن در هوش مصنوعی تشویق کند.

از سوی دیگر این مدل تنها برای کاربردهای غیر تجاری ارائه شده که به کاربران مجوز استفاده، اصلاح و ایجاد نسخه‌های جانبی از Spirit LM را صرفا در پروژه‌های شخصی و غیرتجاری می‌دهد. 

«مارک زاکربرگ»، مدیرعامل متا از حامیان پروپاقرص هوش مصنوعی متن‌باز است. وی اخیرا در نامه‌ای سرگشاده گفته بود که هوش مصنوعی پتانسیل افزایش بهره‌وری، خلاقیت و کیفیت زندگی انسان را دارد و پیشرفت‌های علمی را تسریع می‌کند.

 

دیگر محصولات معرفی شده در رویداد متا

تیم توسعه Meta FAIR در این رویداد از محصولات دیگری هم در زمینه هوش مصنوعی رونمایی کرد. 

 

مدل‌ SAM 2.1 

این مدل به‌طور خودکار تصاویر را پردازش کرده و اجزای مختلف آن را از یکدیگر تفکیک می‌کند. SAM 2.1  در زمینه‌های مختلفی مانند ویرایش تصاویر، واقعیت افزوده، تشخیص اشیاء، رباتیک و خودروهای خودران قابل استفاده است.

مدل مذکور با مجموعه‌ای بسیار وسیع از داده‌ها آموزش دیده و فارغ از وضوح یا محتوای تصویر، اشیاء مختلف را تشخیص می‌دهد؛ حتی اگر قبلا نمونه آن را ندیده باشد. کاربران می‌توانند با کلیک روی اشیاء مورد نظر در تصویر یا ویدیو به مدل کمک کنند تا آن‌ها را به طور دقیق‌تر جدا کند. 

 

معماری LayerSkip

یک معماری جدید در طراحی شبکه‌های عصبی است که به منظور بهینه‌سازی و افزایش کارایی مدل‌ها معرفی شده است. LayerSkip به مدل‌ها اجازه می‌دهد که در فرآیند پردازش داده‌ برخی لایه‌ها را نادیده بگیرند تا مصرف منابع محاسباتی کاهش یافته و در عین حال سرعت و دقت بالاتر برود.

 

تکنیک SALSA

یک رویکرد جدید برای همگام‌سازی فضای نهفته (Latent Space) در مدل‌های چندوجهی است که برای داده‌های صوتی و متنی مزایای بسیاری دارد. این تکنیک کارایی مدل‌ها را در ادغام و پردازش همزمان داده‌های صوتی و متنی بهبود می‌بخشد.

مدل‌ها با تکنیک SALSA اطلاعات را به شکلی هماهنگ‌تر و دقیق‌تر پردازش می‌کنند که نتیجه آن تولید خروجی طبیعی، روان و باکیفیت بالاتر است.

 

مدل  Lingua

مدل‌های هوش مصنوعی فعلی در درک و تولید زبان‌های کمتر شناخته‌شده با مشکل مواجه هستند و متا با معرفی Lingua در پی حل این چالش است. این مدل به طور ویژه برای زبان‌هایی طراحی شده که کمتر مورد استفاده قرار می‌گیرند و هدف آن کمک به توسعه سیستم‌های چندزبانه، بهبود کیفیت ترجمه و ارتقای درک متون در زبان‌های مختلف است.

 

منابع

Meta

 

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

1 × 5 =