جمینی قابلیتهای جدیدی در زمینه کلاهبرداری صدا و گفتار دراماتیک اضافه میکند
گوگل در حال گسترش قابلیتهای مدلهای هوش مصنوعی جمینی خود با فناوری جدید تبدیل متن به گفتار است که به تولید صداهایی طبیعیتر و بیانگر کمک میکند. سیستمهای جدید میتوانند دامنه وسیعتری از ویژگیهای صوتی را بازتولید کنند و به گفتار تولید شده اجازه میدهند تا تغییرات در لحن، لهجه، ریتم و احساسات را منعکس کند.
این بهروزرسانی بخشی از توسعه وسیعتر خانواده جمینی است، زیرا این شرکت به حرکت فراتر از تولید متن ساده ادامه میدهد و به سمت سیستمهای هوش مصنوعی چندرسانهای که قادر به کار با صدا، تصاویر، ویدیو و سایر اشکال محتوا هستند، پیش میرود.
از جمله ارائههای جدید، جمینی فلش TTS و فلش-لایت TTS هستند که کنترل بیشتری بر روی نحوه انتقال گفتار تولید شده به کاربران و توسعهدهندگان میدهند. به جای تبدیل صرف متن نوشته شده به کلمات گفتاری، مدلها میتوانند دستورالعملهای دقیقی را دنبال کنند که توصیف میکند یک خط خاص چگونه باید صدا دهد، از جمله تغییرات در سرعت، شدت، مکثها، زمزمهها، خنده و سایر نشانههای صوتی.
گوگل میگوید فناوری آن میتواند صداهای اصلی را از توصیفهای زبان طبیعی تولید کند و از بیش از 100 زبان و گویش پشتیبانی میکند. این شرکت همچنین یک کتابخانه بزرگ از صداهای آماده به استفاده را برای اهداف تولید در دسترس قرار میدهد، در حالی که یک نمونه کوتاه صوتی میتواند برای ایجاد یک صدای مصنوعی ثابت استفاده شود زمانی که کاربر مجوز لازم را دارد.
این فناوری بهویژه برای موقعیتهایی که شامل گفتگو و اجرای شخصیتها است، مناسب است. یک سناریوی واحد میتواند به یک مکالمه شامل صداهای مختلف تبدیل شود، در حالی که سیستم ثبات بین شخصیتها را در ضبطهای طولانیتر حفظ میکند. چنین قابلیتهایی میتواند برای پادکستها، کتابهای صوتی، دوبله، ویدیوهای روایت شده و برنامههای مبتنی بر صدا مفید باشد.
بهبودها همچنین نشاندهنده رقابت فزاینده در بازار صدای تولید شده توسط هوش مصنوعی هستند، جایی که شرکتها در تلاشند تا گفتار مصنوعی را بهطور فزایندهای طبیعی و بیانگر کنند. آزمایشهای خود گوگل نتایج قوی را در چندین ارزیابی کیفیت صدا نشان داده است، اگرچه خدمات رقیب نیز در دستههای خاصی مرتبط با واقعگرایی و تنوع صوتی عملکرد خوبی داشتهاند.
فناوری جدید محدود به توسعهدهندگان نیست. گوگل شروع به ادغام مدلهای صوتی خود در محصولاتی مانند NotebookLM کرده است، در حالی که فلش-لایت TTS نیز در حال معرفی به Google Vids است. توسعهدهندگان میتوانند به مدلها از طریق ابزارهای توسعه هوش مصنوعی و APIهای گوگل دسترسی پیدا کنند و فناوری را به دامنه وسیعتری از کاربردها باز کنند.
کلاهبرداری صدا همچنین سوالات مهمی درباره رضایت، جعل هویت و احتمال سوءاستفاده از صداهای مصنوعی ایجاد میکند. بنابراین، گوگل تدابیری را معرفی کرده است که نیاز به مجوز برای بازتولید صدای یک شخص دارد و از فناوریهایی مانند SynthID و اعتبارنامههای C2PA برای کمک به شناسایی محتوای تولید شده توسط هوش مصنوعی استفاده میکند.
دسترسپذیری برخی از عملکردهای کلاهبرداری صدا همچنین تابع محدودیتهای منطقهای است که منعکسکننده محیطهای قانونی و نظارتی مختلف در اطراف رسانههای مصنوعی است.
با این تحولات، فناوری گفتار جمینی به سمت رویکردی متمرکز بر اجرا حرکت میکند که در آن صداهای تولید شده توسط هوش مصنوعی میتوانند نه تنها کلمات، بلکه عناصر بیان و احساسات را نیز منتقل کنند. این تغییر نشان میدهد که چگونه هوش مصنوعی تولیدی بهطور فزایندهای در تولید خلاقانه ادغام میشود، در حالی که سوالات مربوط به رضایت، شفافیت و استفاده مسئولانه همچنان در مرکز توسعه فناوری کلاهبرداری صدا باقی مانده است.
-
20:00
-
19:47
-
19:32
-
19:15
-
19:15
-
19:00
-
18:42
-
18:21
-
18:05
-
17:45
-
17:24
-
17:10
-
16:47
-
16:32
-
16:16
-
15:50
-
15:32
-
15:15
-
15:00
-
14:41
-
14:21
-
14:05
-
13:45
-
13:30
-
13:13
-
12:47
-
12:30
-
12:12
-
11:47
-
11:32
-
11:15
-
10:50
-
10:32
-
10:15
-
10:00
-
09:42
-
09:25
-
09:09
-
08:47
-
08:32
-
08:15
-
22:00
-
21:30