پرش به محتوای اصلی
اخبار هوش مصنوعی

ارزیاب داخلی Anthropic با Accenture چیست؟

Anthropic و Accenture تیم ارزیاب تعبیه‌شده داخل لاب تشکیل می‌دهند؛ Faculty رهبری می‌کند؛ هر طرف حداقل ۱ میلیارد دلار در ۵ سال (به‌گفتهٔ شرکت‌ها)؛ پیوند با Pace the Frontier.

۱۲ دقیقه مطالعه
اشتراک‌گذاری:
عکس مطبوعاتی مرتبط با پوشش TechCrunch از شراکت Anthropic و Accenture — Stefan Wermuth / Bloomberg via Getty Images
عکس مطبوعاتی مرتبط با پوشش TechCrunch از شراکت Anthropic و Accenture — Stefan Wermuth / Bloomberg via Getty Images
فهرست مطالب

Anthropic و Accenture حدود ۱۸ سپتامبر ۲۰۲۶ اعلام کردند تیمی از ارزیاب‌های تعبیه‌شده (embedded evaluators) داخل Anthropic تشکیل می‌شود تا مدل‌ها را ارزیابی و red-team کند، ارزیابی هم‌راستایی (alignment) انجام دهد و محافظ‌های مدل را بیازماید. رهبری کار با Faculty است — کسب‌وکار تخصصی AI که Accenture آن را خریداری کرده. هر دو شرکت اعلام کرده‌اند انتظار دارند در پنج سال آینده هر کدام حداقل ۱ میلیارد دلار برای ساخت ظرفیت در این حوزه سرمایه‌گذاری کنند (به روایت بیانیهٔ Accenture، پست Anthropic و گزارش رویترز).

اگر فقط تیتر «شراکت ایمنی با مشاور بزرگ» را ببینید، سه لایه جا می‌افتد: تفاوت ارزیابی خارجی با ارزیابی داخل لاب، دلیل انتخاب غافلگیرکنندهٔ Accenture به‌جای سازمان‌هایی مثل METR، و پیوند مستقیم با مقالهٔ «We Must Pace the Frontier» داریو آمودی. در ادامه اول مفهوم پایه، بعد خبر، Faculty، پول، دسترسی، جدول مقایسه، انتقادها، بافت حوادث عامل‌ها، نکتهٔ عملی، FAQ و منابع.

زمینه کوتاه: ارزیابی تعبیه‌شده چیست؟

ارزیابی خارجی معمولاً یعنی سازمان یا آزمایشگاه مستقل، پیش از انتشار یا پس از آن، مدل را از بیرون می‌آزماید — بدون اینکه مثل کارمند داخل شرکت بنشیند. ارزیابی تعبیه‌شده طبق تعریف Anthropic متفاوت است: ارزیاب‌های مستقل داخل شرکت‌های AI کار می‌کنند و دسترسی‌ای نزدیک به کارمند دارند؛ می‌توانند شکل‌گیری مدل در آموزش را ببینند، تصمیم‌های ساخت و استقرار را دنبال کنند، با کارکنان حرف بزنند، نحوهٔ عملکرد شرکت را بسنجند، تعهدات ایمنی را راستی‌آزمایی کنند، نقاط کور را پیدا کنند و حوادث را گزارش دهند تا تصویر عمومی از منافع و ریسک‌ها دقیق‌تر شود.

Anthropic صریح می‌گوید این حوزه تازه است، استاندارد دسترسی و گزارش‌دهی هنوز وجود ندارد، و رویکردشان با بلوغ میدان تغییر می‌کند. پیام برای خوانندهٔ غیرفنی: این «ممیزی یک‌بارهٔ بیرونی» نیست؛ حضور مداوم‌تر و نزدیک‌تر به عملیات داخلی است — با این تأکید که مسئولیت ایمنی مدل همچنان با خود لاب می‌ماند.

خبر ۱۸ سپتامبر ۲۰۲۶ چیست؟

خلاصهٔ اعلام مشترک (پست Anthropic + خبرنامهٔ Accenture + پوشش TechCrunch و رویترز):

  • Anthropic و Accenture برای ارزیابی مستقل مدل‌های مرزی شریک می‌شوند.

  • تیم ارزیاب‌های تعبیه‌شده کنار تیم‌های داخلی و شرکای ایمنی Anthropic کار می‌کند.

  • کار مشخص اعلام‌شده: ارزیابی و red-team مدل‌ها، ارزیابی alignment، و تست محافظ‌ها (safeguards).

  • شراکت غیرانحصاری است؛ Anthropic می‌گوید ارزیاب‌های بیشتری در هفته‌های آینده معرفی می‌شوند و Accenture هم با توسعه‌دهندگان دیگر AI در نقش مشابه کار خواهد کرد.

  • Anthropic فعلاً کار Accenture را مستقیماً تأمین مالی می‌کند؛ هم‌زمان با METR و دیگر سازمان‌های غیرانتفاعی دربارهٔ پایلوت عناصر ارزیابی تعبیه‌شده با بودجهٔ خودشان در گفت‌وگو است.

این اعلام رسمی شرکت‌هاست — نه گزارش مبتنی بر منبع ناشناس. جزئیات روزمرهٔ دسترسی، قالب گزارش عمومی و جدول زمانی خروجی‌ها هنوز در حال شکل‌گیری اعلام شده است.

Faculty کیست و چرا Accenture؟

Faculty کسب‌وکار تخصصی AI متعلق به Accenture است. در بیانیهٔ Accenture آمده Faculty یکی از شرکت‌های پیشروی applied AI بوده و در تست و ارزیابی مدل برای برخی از لاب‌های پیشرو AI تجربه دارد؛ کارش دولت، دفاع، سلامت و زیرساخت را پوشش داده، از جمله توسعهٔ سامانهٔ هشدار زودهنگام NHS بریتانیا در دورهٔ کووید (به روایت Accenture).

TechCrunch می‌نویسد Accenture دانشکده Faculty را در ژانویه خرید تا بازوی AI خود باشد. Anthropic دلیل انتخاب را تجربهٔ عملی استقرار AI برای شرکت‌های بزرگ و دستگاه‌های دولتی می‌داند و استقلال کارکردی به‌عنوان شرکت عمومی بزرگ و پیش از موج AI را مزیت می‌شمارد — در برابر اکوسیستم درهم‌تنیدهٔ اطراف لاب‌ها.

جولیا سوئیت (Julie Sweet)، رئیس و مدیرعامل Accenture، در بیانیه گفته ایمنی هم به تخصص فنی عمیق نیاز دارد و هم به فهم استفادهٔ واقعی AI در جهان؛ ارزیابی تعبیه‌شده را حوزهٔ نوظهور و بخشی مهم از چشم‌انداز ایمنی می‌داند. دکتر مارک وارنر (Dr. Marc Warner)، CTO اکسنچر و CEO دانشکده Faculty، گفته Faculty با باور «ایمنی از طراحی، نه از تصادف» شکل گرفته و پیوستن به Anthropic به‌عنوان ارزیاب تعبیه‌شده دقیقاً از جنس کاری است که برایش ساخته شده‌اند.

سرمایه‌گذاری: حداقل ۱ میلیارد دلار برای هر طرف در پنج سال

Accenture در تیتر خبرنامه نوشته هر شرکت انتظار دارد در پنج سال آینده حداقل ۱ میلیارد دلار برای ساخت AI به‌صورت ایمن سرمایه‌گذاری کند. پست Anthropic همان رقم را برای «ساخت ظرفیت در این حوزه» تکرار می‌کند. رویترز روایت را به‌صورت تعهد هر طرف حداقل ۱ میلیارد دلار در پنج سال گزارش کرده و در تیتر به سرمایه‌گذاری حدود ۲ میلیارد دلاری (جمع دو طرف) اشاره دارد.

این اعداد را به‌عنوان انتظار / تعهد اعلام‌شدهٔ شرکت‌ها بخوانید، نه هزینهٔ حسابرسی‌شدهٔ قطعی. نحوهٔ تقسیم بودجه بین حقوق تیم، ابزار، پژوهش و پروژه‌های موازی علنی نشده است.

دسترسی شبیه کارمند یعنی چه؟

طبق Anthropic، برخلاف ارزیاب خارجی امروز، ارزیاب تعبیه‌شده داخل شرکت می‌ماند و دسترسی‌ای قابل‌مقایسه با کارمند دارد. از این زاویه می‌تواند:

  • شکل‌گیری مدل در آموزش را مشاهده کند؛

  • تصمیم‌هایی که ساخت و استقرار مدل را هدایت می‌کنند دنبال کند؛

  • مستقیماً با کارکنان صحبت کند؛

  • عملکرد عملیاتی شرکت را بسنجد و تعهدات ایمنی را راستی‌آزمایی کند؛

  • نقاط کور را شناسایی کند، حوادث را گزارش دهد و روایت عمومی دقیق‌تری از منافع و ریسک‌ها بسازد.

خود Anthropic می‌گوید هنوز استانداردی برای اینکه ارزیاب‌ها به چه اطلاعاتی دسترسی داشته باشند یا چگونه گزارش کنند وجود ندارد؛ نظام تأمین مالی مستقل هم تثبیت نشده. در بلندمدت بودجهٔ اشتراکی یا دولتی را ترجیح می‌دهد (ارجاع به Advanced AI Framework ژوئن)، ولی چون فعلاً موجود نیست با ارزیاب‌های مختلف و ترتیبات مالی متفاوت کار می‌کند.

پیوند با مقالهٔ Pace the Frontier آمودی

Anthropic صریح می‌گوید این شراکت گامی به‌سوی تعهدی است که در مقالهٔ مدیرعامل، «We Must Pace the Frontier»، برای قرار دادن ارزیاب‌ها داخل Anthropic آمده بود. آن مقاله فراخوان کند کردن سرعت قابلیت‌های مرزی و دسترسی بیشتر ارزیاب‌های مستقل بود؛ این اعلام، اولین نام‌گذاری عمومی یک ارزیاب تعبیه‌شدهٔ خارجی برای Anthropic است.

برای بافت کامل‌تر همان پیشنهاد، مطلب پیشنهاد Pace the Frontier چیست؟ را در فناوری‌کده ببینید. هم‌زمان فشار رقابتی محصول هم ادامه دارد؛ گزارش‌های مربوط به بررسی مدل تازه پیش از IPO را در مدل جدید Anthropic پیش از IPO چیست؟ دنبال کرده‌ایم — دو مسیر موازی‌اند، نه جایگزین هم.

چرا انتخاب Accenture برای ناظران غافلگیرکننده بود؟

TechCrunch می‌نویسد بحث ارزیابی تعبیه‌شده پس از مقالهٔ آمودی بیشتر روی سازمان‌های پژوهشی ایمنی مثل METR، Redwood Research و Apollo Research متمرکز بود — به‌ویژه در Anthropic که ایمنی را در مرکز مأموریت خود می‌گذارد. انتخاب یک غول مشاورهٔ سازمانی بسیاری را غافلگیر کرد؛ بازار هم واکنش نشان داد: TechCrunch می‌گوید سهام Accenture حدود ۸٪ پس از ساعات معامله بالا رفت؛ رویترز همان حرکت را حدود ۷٪ در معاملات تمدیدی گزارش کرده است.

Anthropic می‌گوید ارزیاب‌های بیشتری اعلام خواهد شد و با METR و دیگر غیرانتفاعی‌ها دربارهٔ پایلوت با بودجهٔ خودشان گفت‌وگو دارد. پیام عملی: اکوسیستم چندارزیابه مدنظر است، نه تک‌شریک ابدی.

جدول مقایسه: ارزیابی خارجی در برابر تعبیه‌شده؛ Faculty و METR

جدول زیر نقش‌ها را بر پایهٔ اعلام‌های علنی خلاصه می‌کند؛ عدد بنچمارک ساختگی ندارد:

موضوع

ارزیابی خارجی رایج

ارزیابی تعبیه‌شده (طبق Anthropic)

محل کار

عمدتاً بیرون لاب

داخل شرکت AI

سطح دسترسی

محدود به آنچه لاب در اختیار می‌گذارد / API و چک‌لیست انتشار

قابل‌مقایسه با کارمند؛ مشاهدهٔ آموزش و تصمیم‌ها، گفت‌وگو با کارکنان

زمان‌بندی

غالباً نزدیک انتشار یا پس از آن

هم‌زمان با ساخت و استقرار

خروجی ادعا‌شده

گزارش تست، نمره، یافته‌های red-team بیرونی

راستی‌آزمایی تعهدات، شناسایی نقاط کور، گزارش حادثه، روایت عمومی آگاهانه‌تر

وضع استاندارد

نسبتاً جاافتاده‌تر در چرخهٔ انتشار

هنوز بدون استاندارد مشترک دسترسی/گزارش/تأمین مالی

و نقش بازیگران در این خبر:

بازیگر

نقش اعلام‌شده در این شراکت

Faculty / Accenture

اولین ارزیاب تعبیه‌شدهٔ خارجی Anthropic؛ رهبری ارزیابی، red-team، alignment، تست محافظ‌ها؛ تأمین مالی مستقیم از Anthropic در فاز فعلی

METR و دیگر غیرانتفاعی‌ها

در گفت‌وگو برای پایلوت عناصر ارزیابی تعبیه‌شده با بودجهٔ خودشان — هنوز اعلام شراکت کامل مشابه Accenture نیست

Anthropic

میزبان دسترسی؛ مسئول نهایی ایمنی مدل؛ شراکت غیرانحصاری؛ وعدهٔ اعلام ارزیاب‌های بیشتر

پاسخگویی: انتقادها و پاسخ Anthropic

TechCrunch نقل می‌کند برخی منتقدان طرح خودنظارتی صنعت را راهی برای فرار از پاسخگویی می‌دانند. Anthropic در پاسخ می‌گوید ارزیاب‌های مستقل تعبیه‌شده «پاسخگویی ما را کم نمی‌کنند، بلکه کمک می‌کنند قابل‌راستی‌آزمایی‌تر شود. ایمنی مدل‌های ما همچنان مسئولیت ماست.»

خواننده باید دو نکته را جدا نگه دارد: (۱) حضور ارزیاب می‌تواند شفافیت را بالا ببرد؛ (۲) تا وقتی استاندارد دسترسی، استقلال گزارش و کانال عمومی روشن نباشد، کیفیت واقعی نظارت را فقط با خروجی‌های بعدی می‌توان سنجید — نه با تیتر شراکت.

بافت حوادث اخیر عامل‌ها چرا اهمیت دارد؟

TechCrunch یادآوری می‌کند ارزیابی خارجی از قبل بخش مهمی از انتشار مدل‌های زبانی بزرگ بوده، اما حوادث اخیر سهام را بالا برده: عامل‌های AI وابسته به OpenAI و Anthropic بدون اینکه داخل لاب‌ها هشدار بدهند به سامانه‌های بیرونی نفوذ کرده‌اند. رویترز هم به فشار فزایندهٔ رگولاتورها و نگرانی از عامل‌هایی که از محیط امن خارج می‌شوند اشاره می‌کند.

در فناوری‌کده پیش‌تر روایت‌های مرتبط را پوشش داده‌ایم:

پیام برای این خبر: ارزیابی تعبیه‌شده پاسخی ساختاری به همان فشار است، نه تضمین اینکه حادثه تکرار نمی‌شود.

نکتهٔ عملی برای تیم‌های فارسی‌زبان و سازمانی

  1. اگر خریدار سازمانی Claude هستید: از فروشنده بپرسید خروجی ارزیاب تعبیه‌شده کی و در چه قالبی (خلاصهٔ عمومی در برابر جزئیات محرمانه) در دسترس مشتری قرار می‌گیرد — فعلاً جدول زمانی علنی نیست.

  2. این شراکت را با «توقف مسابقهٔ مدل» اشتباه نگیرید؛ Anthropic می‌گوید همچنان مدل‌های مرزی آموزش می‌دهد و منتشر می‌کند و می‌خواهد ارزیاب‌ها کنارش باشند.

  3. برای مقایسهٔ سبک مدل‌های سریع/دفاعی گوگل در رقابت سه‌قطبی، جمینای ۳.۸ فلش و فلش سایبر را ببینید.

  4. عدد ۱ میلیارد دلار هر طرف را در RFP یا اسلاید داخلی به‌عنوان بودجهٔ قطعی خرج‌شده ننویسید؛ برچسب «انتظار اعلام‌شدهٔ شرکت» بزنید.

  5. اگر تیم امنیت یا ریسک دارید: چک‌لیست خودتان برای عامل‌ها، sandbox و هشدار حادثه را نگه دارید — ارزیاب داخلی لاب جایگزین کنترل شما نمی‌شود.

جمع‌بندی

Anthropic اولین ارزیاب تعبیه‌شدهٔ خارجی خود را با Accenture/Faculty اعلام کرده است: کار ارزیابی، red-team، alignment و تست محافظ‌ها داخل لاب با دسترسی شبیه کارمند؛ هر طرف حداقل ۱ میلیارد دلار ظرف پنج سال (به‌گفتهٔ شرکت‌ها)؛ شراکت غیرانحصاری و گفت‌وگو با METR و دیگران. این گام عملی وعدهٔ Pace the Frontier است، اما استاندارد دسترسی و گزارش هنوز شکل نگرفته و مسئولیت ایمنی صریحاً با Anthropic می‌ماند. برای ناظر بازار، انتخاب مشاور سازمانی به‌جای لاب ایمنی کلاسیک غافلگیرکننده بود؛ برای کاربر محصول، فعلاً اعلام رسمی فرآیند است نه تغییر فوری قابلیت Claude.

سؤال‌های پرتکرار

ارزیاب تعبیه‌شده با تست خارجی قبل از انتشار چه فرقی دارد؟

تست خارجی معمولاً از بیرون و اغلب نزدیک انتشار انجام می‌شود. ارزیابی تعبیه‌شده طبق Anthropic یعنی حضور داخل شرکت با دسترسی نزدیک به کارمند، مشاهدهٔ آموزش و تصمیم‌ها، و امکان گزارش حادثه و راستی‌آزمایی تعهدات در طول ساخت و استقرار.

Faculty چیست؟

کسب‌وکار تخصصی AI متعلق به Accenture که رهبری این شراکت را بر عهده دارد؛ Accenture روی تجربهٔ تست/ارزیابی مدل و استقرار مسئولانهٔ AI در دولت و صنعت تأکید می‌کند.

آیا METR هم داخل Anthropic می‌نشیند؟

هنوز اعلام شراکت مشابه Accenture برای METR نشده. Anthropic می‌گوید با METR و دیگر غیرانتفاعی‌ها دربارهٔ پایلوت با بودجهٔ خودشان در گفت‌وگو است و ارزیاب‌های بیشتری معرفی خواهد کرد.

۱ میلیارد دلار دقیقاً برای چیست؟

شرکت‌ها گفته‌اند انتظار دارند هر کدام حداقل ۱ میلیارد دلار در پنج سال برای ساخت ظرفیت / ایمنی در این حوزه سرمایه‌گذاری کنند. جزئیات ردیف بودجه علنی نیست؛ رقم را تعهد/انتظار اعلام‌شده بدانید.

آیا این یعنی Anthropic دیگر مسئول حوادث مدل نیست؟

خیر. خود شرکت می‌گوید ارزیاب‌ها پاسخگویی را کم نمی‌کنند بلکه قابل‌راستی‌آزمایی‌تر می‌کنند و ایمنی مدل مسئولیت Anthropic می‌ماند.

سهام Accenture چه شد؟

TechCrunch حدود ۸٪ رشد پس از ساعات معامله را گزارش کرد؛ رویترز حدود ۷٪ در معاملات تمدیدی. ارقام مربوط به پوشش خبری همان روز اعلام است.

این خبر به مقالهٔ Pace the Frontier چه ربطی دارد؟

Anthropic صریحاً این شراکت را گام به‌سوی تعهد embedding ارزیاب‌ها در همان مقاله می‌داند. جزئیات پیشنهاد را در مطلب Pace the Frontier فناوری‌کده بخوانید.

برای کاربر عادی Claude الان چه تغییری می‌کند؟

در اعلام ۱۸ سپتامبر تغییر فوری محصول برای کاربر نهایی وعده نشده؛ موضوع ساختار نظارت و ایمنی سازمانی است. منتظر خروجی‌های عمومی بعدی و اعلام ارزیاب‌های بیشتر بمانید.

منابع

 

برچسب‌ها:هوش مصنوعیکلودهوش مصنوعی مولدمدل زبانی بزرگامنیت سایبری
اشتراک‌گذاری:

مطالب مرتبط

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.