سهشنبه 5 فروردین 1404 – 19:45
ویژگی منحصربهفرد این مدل استفاده از مجوز MIT است که اجازه استفاده تجاری رایگان را برای کاربران فراهم میکند. بنچمارکهای اولیه نشان میدهند که این مدل برخلاف بسیاری از مدلهای زبانی قدرتمند که نیازمند مراکز داده با توان پردازشی فراوان هستند، ازپس اجرا روی سختافزارهای مصرفی مانند مک استودیو اپل با تراشه M3 اولترا برمیآید. طبق گزارش دانشمند هوش مصنوعی، Awni Hannun، این مدل در چنین سیستمی به سرعت پردازش بیش از ۲۰ توکن بر ثانیه میرسد.
ازنظر فنی، DeepSeek-V3-0324 مبتنیبر معماری Mixture-of-Experts یا MoE طراحی شده است. این ساختار به مدل اجازه میدهد تا در هر وظیفه فقط حدود ۳۷ میلیارد از ۶۸۵ میلیارد پارامتر خود را به کار گیرد که ضمن کاهش بار محاسباتی، عملکرد قدرتمند را تضمین میکند. علاوهبر این، استفاده از فناوریهای Multi-Head Latent Attention یا MLA و Multi-Token Prediction یا MTP به بهبود نگهداری زمینه و افزایش سرعت پاسخدهی مدل کمک کردهاند.
برای مشاهده کامل مطب کلیک کنید
