شرکت «متا» از مدل «Spirit LM» به عنوان نخستین هوش مصنوعی چند وجهی خود رونمایی کرد که متن و صورت را در ورودی و خروجی با هم ترکیب میکند. این مدل با بهرهگیری از روشی نوآورانه صدا را با لحن و بیان بسیار طبیعی تولید کرده و از این نظر مدلهای چندوجهی GPT-4o و Hume EVI 2 را به چالش می کشد.
هوش مصنوعی Spirit LM که توسط تیم «تحقیقات بنیادی هوش مصنوعی متا» (FAIR) طراحی شده، تجربه کاربری از مکالمه صوتی با هوش مصنوعی و گفتار و بیان آن را به سطح جدیدی ارتقا میدهد. در ویدیوهای نمونه صدا و لحن مدل به حدی طبیعی است که تشخیص آن از انسان ناممکن خواهد بود.
این مدل همچنین مهارتهای خود را در حوزههای مختلف مانند تشخیص خودکار گفتار (ASR)، تبدیل متن به گفتار (TTS) و طبقهبندی گفتار بهبود میبخشد.

رویکرد جدید در تبدیل متن به صوت
مدلهای سنتی برای پردازش ورودی صوتی از تشخیص خودکار گفتار بهره میبرند که طی آن ورودی صوتی به متن تبدیل شده و پس از پردازش توسط ماشین دوباره به صوت تبدیل میشود.
این روش با وجود کارآمدی ویژگیهای انسانی صدا از جمله لحن و احساس را از بین میبرد. مدل Spirit LM برای غلبه بر این محدودیت از روشی جدید بهره میبرد که گام، آهنگ و لحن صدا را به خوبی حفظ میکند.
مدل جدید متا در دو نسخه معرفی شده است:
- Spirit LM Base: از توکنهای آوایی برای پردازش و تولید صدا استفاده میکند.
- Spirit LM Expressive: شامل توکنهای بیشتری است که جنبههای احساسی مثل غم و هیجان را در صدای ورودی شناسایی کرده و در خروجی منعکس میکند.
هر دو مدل روی ترکیبی از دادههای متنی و صوتی آموزش دیدهاند که به Spirit LM امکان میدهد وظایف چندوجهی مانند تبدیل متن به صوت و صوت به متن را انجام داده و درعینحال بیان طبیعی را در خروجیها حفظ کند.
کاربردها و پتانسیلهای مدل
هوش مصنوعی یا مدل Spirit LM به شکلی طراحی شده که توان یادگیری وظایف چندوجهی جدید را دارد:
- تشخیص گفتار خودکار: فرایند ASR که در آن سیگنالهای صوتی به متن تبدیل میشوند.
- تبدیل متن به صوت: فرایند TTS که در آن متن ورودی به سیگنالهای صوتی تبدیل میشود.
- طبقهبندی گفتار: شناسایی و دستهبندی صدا بر اساس محتوا، لحن، گوینده یا زبان.
نسخه Spirit LM Expressive با تشخیص احساساتی مثل غم، خشم یا تعجب در صدای ورودی یک گام فراتر میرود. برای مثال اگر صدای ورودی غمگین باشد آن را تشخیص داده و خروجی را با همان لحن ارائه میکند. توسعه چنین مدلی در مواردی مثل بات پشتیبان و دستیار مجازی که تعامل انسانی در آنها مهم است، یک پیشرفت قابلتوجه به شمار میرود.

متنباز و غیرتجاری
متا مدل زبانی Spirit LM را به طور کامل متنباز کرده که در راستای تعهد این شرکت به جامعه علمی آزاد قرار دارد. این شرکت ویژگیهای فنی مدل از جمله وزن، کد و مستندات آن را در اختیار محققان و توسعهدهندگان قرار داده تا آنها را به یافتن روشهای جدید برای تلفیق گفتار و متن در هوش مصنوعی تشویق کند.
از سوی دیگر این مدل تنها برای کاربردهای غیر تجاری ارائه شده که به کاربران مجوز استفاده، اصلاح و ایجاد نسخههای جانبی از Spirit LM را صرفا در پروژههای شخصی و غیرتجاری میدهد.
«مارک زاکربرگ»، مدیرعامل متا از حامیان پروپاقرص هوش مصنوعی متنباز است. وی اخیرا در نامهای سرگشاده گفته بود که هوش مصنوعی پتانسیل افزایش بهرهوری، خلاقیت و کیفیت زندگی انسان را دارد و پیشرفتهای علمی را تسریع میکند.
دیگر محصولات معرفی شده در رویداد متا
تیم توسعه Meta FAIR در این رویداد از محصولات دیگری هم در زمینه هوش مصنوعی رونمایی کرد.
مدل SAM 2.1
این مدل بهطور خودکار تصاویر را پردازش کرده و اجزای مختلف آن را از یکدیگر تفکیک میکند. SAM 2.1 در زمینههای مختلفی مانند ویرایش تصاویر، واقعیت افزوده، تشخیص اشیاء، رباتیک و خودروهای خودران قابل استفاده است.
مدل مذکور با مجموعهای بسیار وسیع از دادهها آموزش دیده و فارغ از وضوح یا محتوای تصویر، اشیاء مختلف را تشخیص میدهد؛ حتی اگر قبلا نمونه آن را ندیده باشد. کاربران میتوانند با کلیک روی اشیاء مورد نظر در تصویر یا ویدیو به مدل کمک کنند تا آنها را به طور دقیقتر جدا کند.
معماری LayerSkip
یک معماری جدید در طراحی شبکههای عصبی است که به منظور بهینهسازی و افزایش کارایی مدلها معرفی شده است. LayerSkip به مدلها اجازه میدهد که در فرآیند پردازش داده برخی لایهها را نادیده بگیرند تا مصرف منابع محاسباتی کاهش یافته و در عین حال سرعت و دقت بالاتر برود.
تکنیک SALSA
یک رویکرد جدید برای همگامسازی فضای نهفته (Latent Space) در مدلهای چندوجهی است که برای دادههای صوتی و متنی مزایای بسیاری دارد. این تکنیک کارایی مدلها را در ادغام و پردازش همزمان دادههای صوتی و متنی بهبود میبخشد.
مدلها با تکنیک SALSA اطلاعات را به شکلی هماهنگتر و دقیقتر پردازش میکنند که نتیجه آن تولید خروجی طبیعی، روان و باکیفیت بالاتر است.
مدل Lingua
مدلهای هوش مصنوعی فعلی در درک و تولید زبانهای کمتر شناختهشده با مشکل مواجه هستند و متا با معرفی Lingua در پی حل این چالش است. این مدل به طور ویژه برای زبانهایی طراحی شده که کمتر مورد استفاده قرار میگیرند و هدف آن کمک به توسعه سیستمهای چندزبانه، بهبود کیفیت ترجمه و ارتقای درک متون در زبانهای مختلف است.
منابع
