آزمایشگاه مرجع ارزیابی مدل‌های زبانی فارسی

sanje

درباره سنجه

سنجه آزمایشگاه مرجع ارزیابی مدل‌های زبانی بزرگ فارسی است که با همکاری شرکت گسترش فناوری های پیشرفته و هوشمند سینا و آزمایشگاه پردازش زبان طبیعی دانشگاه صنعتی امیرکبیر ایجاد شده است. با توجه به گسترش سریع این مدل‌ها (LLMs)، نیاز به معیارهای دقیق، بومی و استاندارد برای سنجش عملکرد آن‌ها در زبان فارسی بیش از پیش احساس می‌شود. هدف اصلی ما در این پلتفرم، عبور از ارزیابی‌های سطحی و صرفاً ترجمه‌شده و رسیدن به درکی عمیق از توانمندی‌ مدل‌ها در بستر زبان، فرهنگ و الزامات ایمنی کاربران ایرانی است. ما معتقدیم یک مدل قدرتمند فارسی، مدلی است که نه‌تنها در استدلال‌های ریاضی و منطقی موفق باشد، بلکه بتواند پیچیدگی‌های ادبی، کنایه‌ها و خطوط قرمز ایمنی را نیز در بستر جامعه ایران به‌درستی تحلیل و درک کند.

چرا «سنجه»؟

نام این پلتفرم با ظرافت خاصی برای بازتاب هویت و مأموریت آن انتخاب شده است. واژه‌ی «سنجه» در زبان و ادبیات فارسی به معنای «معیار، مقیاس و ابزار اندازه‌گیری» است که دقیقاً رسالت یک بنچمارک را نشان می‌دهد. از سوی دیگر، در زبان انگلیسی، SANJE سرواژه‌ای دقیق از عبارت Sina-Amirkabir Network for Joint Evaluation است. این نام‌گذاری دوگانه، پیوند عمیق هویت بومی پروژه را با ساختار علمی، بین‌المللی و شبکه‌ی همکاری مشترک میان شرکت گسترش فناوری های پیشرفته و هوشمند سینا و آزمایشگاه پردازش زبان طبیعی دانشگاه صنعتی امیرکبیر به تصویر می‌کشد.

نقاط تمایز و برتری‌های «سنجه»

در چند سال اخیر لیدربوردهای ارزشمندی برای ارزیابی مدل‌های زبانی بزرگ فارسی ایجاد شده‌اند که گام‌های مهمی در این راستا برداشته‌اند؛ اما تمرکز اصلی آن‌ها غالباً بر «ترجمه خودکار» بنچمارک‌های انگلیسی به فارسی بوده است. پلتفرم سنجه، با رویکردی متفاوت و بومی‌محور، مزیت‌های رقابتی زیر را ارائه می‌دهد:

۱. شاخص درک و روانی فارسی

زبان فارسی صرفاً مجموعه‌ای از کلمات نیست؛ بلکه ساختار، کنایه‌ها و ظرایف معنایی خاص خود را دارد. برخلاف سایر لیدربوردها، ما شاخص‌های اختصاصی نظیر «درک استعاره و ضرب‌المثل»، «تحلیل آرایه‌های ادبی» و «قرابت معنایی اشعار» را وارد چرخه ارزیابی کرده‌ایم تا عیار واقعی سواد ادبی مدل‌ها سنجیده شود. در همین راستا، برای اولین بار یک معیار ترکیبی اختصاصی با نام PFI یا Persian Fluency Index معرفی کرده‌ایم. این شاخص تعادلی دقیق میان «دانش عمومی» مدل و «سواد زبانی» آن ایجاد می‌کند. در لیدربورد سنجه، مدلی در صدر قرار می‌گیرد که هم توانایی حل مسائل پیچیده را داشته باشد و هم درک درستی از لحن‌ها (رسمی/محاوره‌ای) و ساختارهای زبانی ارائه دهد.

۲. ارزیابی پیشرفته‌ی ایمنی و قابلیت اعتماد

یکی از بزرگ‌ترین نقاط کور لیدربوردهای فعلی فارسی، عدم سنجش دقیق خطرات مدل است. پلتفرم سنجه دارای مجموعه‌داده‌های اختصاصی برای ارزیابی ایمنی است که موارد زیر را به شدت می‌سنجد:

سوگیری بومی: بررسی دقیق جهت‌گیری مدل نسبت به قومیت‌ها، مذاهب و جنسیت در بستر جامعه ایران.

توهم: سنجش میزان دقت مدل در تشخیص اطلاعات ساختگی و تفکیک واقعیت از توهم.

سمی‌بودن: ارزیابی مدل در تشخیص محتوای توهین‌آمیز در راستای پرهیز از تولید محتوای هنجارشکن.

امنیت: ارزیابی مقاومت مدل در برابر درخواست‌های مخرب.

۳. بومی‌سازی عمیق به جای ترجمه سطحی

ترجمه‌ی تحت‌اللفظی و ساده‌ی بنچمارک‌های بین‌المللی، قادر به انتقال ویژگی‌های فرهنگی، هنجارها و اطلاعات بومی جامعه‌ی ما نیست. در پلتفرم «سنجه»، ما به جای ترجمه‌ی صرف، رویکرد «بومی‌سازی عمیق» را اتخاذ کرده‌ایم. در این رویکرد، تمامی عناصر آزمون‌ها از جمله اسامی خاص، موقعیت‌ها، واحدهای اندازه‌گیری و سناریوها، متناسب با فرهنگ، جغرافیا و زیست‌بوم ایران بازطراحی و معادل‌سازی شده‌اند. این تغییرات تضمین می‌کند که توانایی استدلال مدل، نه در یک فضای بیگانه، بلکه در بستری کاملاً ملموس برای کاربران ایرانی ارزیابی شود.
ابعاد اصلی ارزیابی در یک نگاه:

1. دانش و استدلال: : سنجش دانش عمومی، درک مطلب، پازل‌های منطقی و استدلال ریاضی (بومی‌سازی دقیق بنچمارک‌های مرجع).

2. درک زبان و ادبیات: سنجش تسلط بر گرامر، تشخیص استایل‌های نوشتاری، درک تحلیلی شعر و کنایه‌های اصیل فارسی.

3. ایمنی و هم‌راستایی: تست‌های سخت‌گیرانه برای ارزیابی مقاومت مدل در برابر سوگیری‌های شناختی، توهم و پاسخ‌های مخرب.