کلان‌پیکره زبان فارسی ترگمان با ۳۱ میلیارد توکن منتشر شد

کلان‌پیکره ترگمان تاکنون از طریق خزش ۴۲۲ سایت داخلی به حجم مجوع بیش از ۳۱ میلیارد توکن در قالب بیش از ۵۴ میلیون سند در حوزه‌های گوناگون رسیده است. ترگمان در راستای مسوولیت اجتماعی و با هدف گسترش فرهنگ آزادرسانی و تقویت هوش مصنوعی در کشور حق بهره‌برداری از این کلان‌پیکره را حق بهره‌برداری CC-BY-NC-SA قرار داده است.

کلان‌پیکره ترگمان تاکنون از طریق خزش ۴۲۲ سایت داخلی به حجم مجوع بیش از ۳۱ میلیارد توکن در قالب بیش از ۵۴ میلیون سند در حوزه‌های گوناگون رسیده است. ترگمان در راستای مسوولیت اجتماعی و با هدف گسترش فرهنگ آزادرسانی و تقویت هوش مصنوعی در کشور حق بهره‌برداری از این کلان‌پیکره را حق بهره‌برداری CC-BY-NC-SA قرار داده است.

به گزارش پیوست، کلان پیکره زبان فارسی شرکت پردازش هوشمند ترگمان که با هدف آموزش مدل‌های زبانی بزرگ (LLM) مورد استفاده قرار می‌گیرد دارای بیش از ۳۱ میلیارد توکن است. این کلان پیکره شامل تمامی فراداده‌های لازم برای پردازش‌های زبان طبیعی است و داده‌ها در آن با ساختار jsonl. gz منتشر شده‌اند تا در هنگام پردازش به کمترین میزان حافظه نیاز باشد.

کلان‌پیکره ترگمان در نشانی https://huggingface.co/datasets/Targoman/TLPC قرار گرفته و دسترسی به آن نیازمند تأیید است. برای دریافت حق بهره‌برداری غیر تجاری کافی است فرد متقاضی در هاگینگ‌فیس اکانت با لینک به گیت‌هاب داشته باشد یا در حوزه LLM فعالیت کند.

منبع  : ماهنامه پیوست

برای مشاهده کامل مطلب کلیک کنید

اشتراک‌گذاری

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *