امروزه بنچمارکها به معیاری ضروری تبدیل شدهاند تا شرکتهای هوش مصنوعی قابلیتهای مدلهای خود را اثبات کنند و در بازار رقابتی، برتری خود را تبلیغ کنند. با این حال، بسیاری از سیستمهای آزمایشی قدیمی دیگر پاسخگوی نیازهای مدلهای مدرن نیستند و شرکتها راههایی برای عبور هوشمندانه از این سیستمها پیدا کردهاند. استارتاپ «والس» (Vals) که در سال ۲۰۲۴ تأسیس شد، مأموریت خود را اصلاح این سیستم ناقص تعریف کرده است.
رشد سریع و سرمایهگذاری کلان
این شرکت در کمتر از دو سال جایگاه قابل توجهی در صنعت فناوری یافته و موفق شد در سال گذشته، دور سرمایهگذاری Seed خود را با رهبری 8VC و Bloomberg Beta به نتیجه برساند. آخرین موفقیت بزرگ صاله، جذب ۴۰ میلیون دلار سرمایه در دور سری A با رهبری Andreessen Horowitz بود. این رشد سریع نشاندهنده علاقه شدید بازار به یک سیستم ارزیابی دقیقتر است.
ریشههای ایده در شکاف ارزیابی
رایان کریشن، همبنیانگذار ۲۵ ساله Vals که سابقه کارآموزی در Palantir و همکاری با آزمایشگاه هوش مصنوعی استنفورد را دارد، با مشاهده عقبماندگی بنچمارکهای آکادمیک از سرعت پیشرفت مدلها، این ایده را شکل داد. او معتقد است که با نفوذ هوش مصنوعی در تمام ارکان جامعه، آزمایشها باید طوری طراحی شوند که واقعیت عملکرد مدلها را در موارد تبلیغاتی تأیید کنند، نه صرفاً اطلاعات عمومی را بسنجانند.
تفاوت Vals با روشهای سنتی: تمرکز بر دنیای واقعی
در حالی که بسیاری از سیستمهای بنچمارک، سؤالات خود را به صورت عمومی منتشر میکنند که امکان تطبیق مدلها با آنها (و در نتیجه نوعی تقلب آموزشی) را فراهم میکند، Vals از افشای عمومی مواد تستی خودداری میکند. رویکرد این استارتاپ بر ارزیابی توانایی مدلها در انجام وظایف پیچیده و تخصصی در صنایعی مانند حقوق، مالی و برنامهنویسی متمرکز است.
- تمرکز بر پیامدها: بررسی نه فقط نتایج مثبت، بلکه پیامدهای منفی احتمالی اگر مدلها بدون نظارت در دنیای واقعی اجرا شوند.
- تخصصهای نیش: ارائه بنچمارکهای منحصربهفرد در حوزههایی مثل خودبهبودی رecessive، سلامت روان، امنیت سایبری و حتی قوانین جنگ (مانند اعمال کنوانسیون ژنو).
مدل درآمدی: چرا شرکتها پول میدهند؟
شرکتها برای آزمایش مدلهای خود به Vals پول پرداخت میکنند. این مفهوم ممکن است در نگاه اول عجیب به نظر برسد؛ پس چرا یک شرکت هزینه میکند تا بداند مدلش عملکرد ضعیفی دارد؟ کریشن این مدل را به پرداخت هزینههای آزمون SAT توسط دانشآموزان تشبیه میکند؛ هزینهای که برای کشف نقاط ضعف و بهبود مستمر ضروری است. نتایج این ارزیابیها امروزه به عامل کلیدی در تصمیمات خرید و ادغام مدلهای هوش مصنوعی توسط سازمانها تبدیل شده است.
آیندهنگری: اعتماد عمومی و ورود به بازارهای مالی
درآمد Vals در سال جاری هشت برابر سال گذشته شده و تیم آن از ۸ به ۲۵ نفر افزایش یافته است. این استارتاپ اخیراً برنامهای برای ارائه ارزیابی مدلها به نهادهای فدرال راهاندازی کرده است. کریشن پیشبینی میکند که با ورود شرکتهای بزرگی مانند SpaceX، Anthropic و احتمالاً OpenAI به بازارهای عمومی، بنچمارکهای دقیق و مستقل نقش محوری در گزارشهای مالی و ایجاد اعتماد عمومی در آینده هوش مصنوعی ایفا خواهند کرد.
نظر، سوال یا تجربه خود را درباره این مطلب با سایر کاربران اوکالا به اشتراک بگذارید.