Udemy – Mastering Generative Voice AI: From Tokens to Agentic TTS 2026-7
دوره Mastering Generative Voice AI: From Tokens to Agentic TTS. هوش مصنوعی صوتی مولد بسیار فراتر از تبدیل متن به گفتار ساده است و این دوره، یادگیری را از اصول فیزیک صوت آغاز کرده و تا ساخت سیستمهای صوتی هوشمند و در سطح تولید ادامه میدهد. بیشتر دورههای تبدیل متن به گفتار تنها به مدلهای اولیه یا رابطهای برنامهنویسی آماده محدود میشوند، اما این دوره بسیار عمیقتر است. شرکتکنندگان ابتدا با مبانی گفتار انسان شامل آکوستیک، واژهشناسی و لحن آشنا میشوند و سپس به بررسی معماریهای پیشرفته مدلهای صوتی امروزی مانند یادگیری بازنمایی خودنظارتی، کدکهای صوتی عصبی و استراتژیهای نشانهگذاری که به مدلهای زبانی بزرگ اجازه صحبت کردن میدهند، میپردازند. در ادامه، دانشجویان بر دو الگوی رایج مدرن یعنی تبدیل متن به گفتار مبتنی بر کدک خودرگرسیو و انتشار پنهان یا تطبیق جریان شرطی تسلط پیدا میکنند و درک خواهند کرد که هر یک چه زمانی و چرا در سیستمهای واقعی استفاده میشوند. همچنین مدلهای صوتی و متنی یکپارچه، مدلسازی پارالینگویستیک و شبیهسازی صدای صفرشات بررسی میشوند. در بخشهای پایانی، نحوه ساخت خطوط لوله صوتی عاملیتمحور، جریانی و با تاخیر کم آموزش داده میشود که شامل استنتاج قطعهقطعه، رمزگشایی گمانهزنی، پخش جریانی وبسوکت و مدیریت نوبتدهی در گفتار است.
