مدل چندوجهی WeMM-Embedding شرکت Tencent

فهرست مطالب

Tencent مدل هوش مصنوعی چندوجهی WeMM-Embedding را متن‌باز کرد

تیم WeChat Vision شرکت Tencent مدل هوش مصنوعی WeMM-Embedding را به‌صورت متن‌باز منتشر کرده است؛ خانواده‌ای از مدل‌های چندوجهی که برای بهبود جست‌وجو، بازیابی اطلاعات و پیشنهاد محتوا طراحی شده‌اند. این مدل‌ها می‌توانند متن، تصویر، ویدئو، اسناد تصویری و حتی ورودی‌هایی که ترکیبی از چند نوع محتوا هستند را در یک فضای معنایی مشترک نمایش دهند.

در حال توسعه مدل‌های هوش مصنوعی پیشرفته

WeMM-Embedding چه کاری انجام می‌دهد؟

Embedding در واقع روشی برای تبدیل محتوا به نمایش‌های عددی یا برداری است تا سیستم‌های هوش مصنوعی بتوانند ارتباط معنایی میان داده‌های مختلف را تشخیص دهند. WeMM-Embedding این قابلیت را برای چندین نوع محتوا در یک مدل واحد فراهم می‌کند. برای مثال، یک عبارت متنی می‌تواند با تصاویر یا ویدئوهای مرتبط مقایسه شود و سیستم به‌جای جست‌وجوی صرفاً کلمه‌محور، محتوای مرتبط از نظر مفهوم را پیدا کند.
این قابلیت می‌تواند در موتورهای جست‌وجوی چندوجهی، سیستم‌های پیشنهاددهنده، دسته‌بندی محتوا، بازیابی اطلاعات و برخی سیستم‌های مبتنی بر عامل‌های هوش مصنوعی مورد استفاده قرار گیرد.

Tencent سه نسخه WeMM-Embedding را برای جست‌وجوی چندوجهی عرضه کرد

Tencent این خانواده را در سه نسخه 2B، 4B و 9B عرضه کرده است. نکته قابل توجه این است که حتی نسخه 2B در بنچمارک MMEB-v2 توانسته از مدل متن‌باز 8B پیشرو قبلی عملکرد بهتری داشته باشد. نسخه 9B نیز با ثبت امتیاز کلی 80.6 به رکورد جدیدی در این ارزیابی دست یافته است.

مدل‌ها با یک فرایند آموزشی دو مرحله‌ای توسعه داده شده‌اند؛ ابتدا با حجم بزرگی از داده‌های چندوجهی برای ایجاد درک عمومی و سپس با داده‌های گزینش‌شده و آموزش دقیق‌تر برای بهبود تشخیص ارتباط معنایی میان محتواها.

جست‌وجوی چندوجهی متن تصویر و ویدئو با WeMM-Embedding

استفاده در سرویس‌های WeChat

یکی از مهم‌ترین نکات این انتشار، استفاده عملی از WeMM-Embedding پیش از متن‌باز شدن آن است. Tencent اعلام کرده این مدل‌ها در مقیاس بالا در سیستم‌های جست‌وجو و پیشنهاد محتوای WeChat Channels، Official Accounts، Moments و سرویس‌های تجارت الکترونیکی به کار گرفته شده‌اند.

این مدل در یک ارزیابی داخلی شامل ۲۶ وظیفه عملکرد قابل توجهی داشته و در ۱۴ آزمایش A/B آنلاین نیز بهبودهای مداومی ایجاد کرده است.

انتشار کد و وزن‌های مدل

Tencent علاوه بر مدل‌ها، کد، وزن‌ها و ابزارهای ارزیابی WeMM-Embedding را نیز در اختیار توسعه‌دهندگان قرار داده است. این اقدام به پژوهشگران و شرکت‌ها اجازه می‌دهد از این مدل‌ها برای توسعه سیستم‌های جست‌وجو و پیشنهاد محتوای چندوجهی استفاده کنند و عملکرد آن‌ها را در پروژه‌های مختلف بررسی کنند.

در مجموع، انتشار WeMM-Embedding نشان می‌دهد Tencent تلاش دارد بخشی از فناوری مورد استفاده در زیرساخت‌های جست‌وجو و پیشنهاد محتوای WeChat را در اختیار جامعه متن‌باز قرار دهد؛ اقدامی که می‌تواند توسعه ابزارهای هوش مصنوعی برای ارتباط میان متن، تصویر و ویدئو را ساده‌تر کند.

منبع:https://www.xpeng.com/pressroom/news/01a03797fccda01e0de68a02a256006a?utm_source=chatgpt.com

گالری مقاله

avatar

دانلود متن مقاله

نظرات کاربران

دیدگاهی بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

فهرست مطالب