EmbeddingGemma 2 آمد؛ مدل امبدینگ متنباز و چندوجهی که روی گوشی هم اجرا میشود

گوگل دیپمایند نسخهی دوم EmbeddingGemma را منتشر کرد. نسخهی اول فقط امبدینگ متن میساخت و به گفتهی گوگل بیش از ۲۰ میلیون بار دانلود شده؛ نسخهی جدید حالا متن، کد، تصویر، صدا و ویدیو را در یک فضای امبدینگ مشترک نگاشت میکند.
خلاصه خبر
- بر پایهی معماری Gemma 4، با ۷۴۰ میلیون پارامتر و مجوز تجاریپسند Apache 2.0.
- ماژولار است: برای کار فقط-متنی حدود ۲۷۰ میلیون پارامتر کافی است و انکودرهای تصویر (۱۷۰ میلیون) و صدا (۳۰۰ میلیون) اختیاریاند.
- با Matryoshka Representation Learning میشود بردارهای ۷۶۸ بعدی را به ۵۱۲، ۲۵۶ یا ۱۲۸ بعد کوتاه کرد؛ یعنی تا ۶ برابر صرفهجویی در فضای دیتابیس برداری.
- پنجرهی context به ۸ هزار توکن رسیده، یعنی ۴ برابر نسخهی قبل.
- روی کد جهش جدی داشته: امتیاز MTEB Code از ۶۸.۷۶ به ۷۸.۶۸ رسیده؛ گزینهی خوبی برای ایندکس کدبیس و جستوجوی معنایی کد در ایجنتهای کدنویسی.
- به گفتهی گوگل، با کوانتیزهسازی روی Pixel 11 Pro حدود ۱۹۱ مگابایت RAM برای نسخهی متنی و حدود ۵۶۷ مگابایت برای نسخهی کامل چندوجهی لازم دارد. وزنها روی Hugging Face و Kaggle در دسترساند.
نظر من
به نظرم امبدینگ قهرمان گمنام دنیای AI است؛ همه دربارهی مدلهای چت حرف میزنند، ولی کیفیت RAG و جستوجو را امبدینگ تعیین میکند. اینکه یک مدل زیر یک میلیارد پارامتر، متنباز و با Apache 2.0، هم کد بفهمد هم صدا و ویدیو، برای ما توسعهدهندههای ایرانی خیلی ارزشمند است: میشود جستوجوی معنایی و RAG را روی سرور خودمان یا حتی روی دستگاه کاربر اجرا کرد، بدون وابستگی به API خارجی، تحریم و هزینهی دلاری. اگر پروژهای با جستوجوی داخلی، پشتیبانی هوشمند یا ایندکس کدبیس دارید، این مدل ارزش یک تست جدی را دارد. فقط کیفیتش روی متن فارسی را خودتان با دادهی واقعی بسنجید، نه فقط با بنچمارک.