کلانپیکره ترگمان تاکنون از طریق خزش ۴۲۲ سایت داخلی به حجم مجوع بیش از ۳۱ میلیارد توکن در قالب بیش از ۵۴ میلیون سند در حوزههای گوناگون رسیده است. ترگمان در راستای مسوولیت اجتماعی و با هدف گسترش فرهنگ آزادرسانی و تقویت هوش مصنوعی در کشور حق بهرهبرداری از این کلانپیکره را حق بهرهبرداری CC-BY-NC-SA قرار داده است.
به گزارش پیوست، کلان پیکره زبان فارسی شرکت پردازش هوشمند ترگمان که با هدف آموزش مدلهای زبانی بزرگ (LLM) مورد استفاده قرار میگیرد دارای بیش از ۳۱ میلیارد توکن است. این کلان پیکره شامل تمامی فرادادههای لازم برای پردازشهای زبان طبیعی است و دادهها در آن با ساختار jsonl. gz منتشر شدهاند تا در هنگام پردازش به کمترین میزان حافظه نیاز باشد.
کلانپیکره ترگمان در نشانی https://huggingface.co/datasets/Targoman/TLPC قرار گرفته و دسترسی به آن نیازمند تأیید است. برای دریافت حق بهرهبرداری غیر تجاری کافی است فرد متقاضی در هاگینگفیس اکانت با لینک به گیتهاب داشته باشد یا در حوزه LLM فعالیت کند.
