چهارشنبه 5 شهریور 1404 – 10:30 – بهروزشده در شنبه 8 شهریور 1404 – 06:16
یکی از مهمترین عوامل این جهش عملکردی، کاهش قابل توجه نیاز به Tensor Parallelism در GB300 انویدیا است. در حالی که اجرای مدل DeepSeek R1 روی H100 نیازمند تقسیم بار پردازشی در سطح ۱۶ GPU بود، اما معماری جدید GB300 توانست همین مدل را تنها با ۴ GPU و در سطح ۴-way tensor parallelism اجرا کند. این کاهش در تقسیمبندی باعث بهبود ارتباط میان GPUها و کاهش سربار پردازشی شده است.
برای مشاهده کامل مطب کلیک کنید
