فهرست مطالب
Anthropic و Accenture حدود ۱۸ سپتامبر ۲۰۲۶ اعلام کردند تیمی از ارزیابهای تعبیهشده (embedded evaluators) داخل Anthropic تشکیل میشود تا مدلها را ارزیابی و red-team کند، ارزیابی همراستایی (alignment) انجام دهد و محافظهای مدل را بیازماید. رهبری کار با Faculty است — کسبوکار تخصصی AI که Accenture آن را خریداری کرده. هر دو شرکت اعلام کردهاند انتظار دارند در پنج سال آینده هر کدام حداقل ۱ میلیارد دلار برای ساخت ظرفیت در این حوزه سرمایهگذاری کنند (به روایت بیانیهٔ Accenture، پست Anthropic و گزارش رویترز).
اگر فقط تیتر «شراکت ایمنی با مشاور بزرگ» را ببینید، سه لایه جا میافتد: تفاوت ارزیابی خارجی با ارزیابی داخل لاب، دلیل انتخاب غافلگیرکنندهٔ Accenture بهجای سازمانهایی مثل METR، و پیوند مستقیم با مقالهٔ «We Must Pace the Frontier» داریو آمودی. در ادامه اول مفهوم پایه، بعد خبر، Faculty، پول، دسترسی، جدول مقایسه، انتقادها، بافت حوادث عاملها، نکتهٔ عملی، FAQ و منابع.
زمینه کوتاه: ارزیابی تعبیهشده چیست؟
ارزیابی خارجی معمولاً یعنی سازمان یا آزمایشگاه مستقل، پیش از انتشار یا پس از آن، مدل را از بیرون میآزماید — بدون اینکه مثل کارمند داخل شرکت بنشیند. ارزیابی تعبیهشده طبق تعریف Anthropic متفاوت است: ارزیابهای مستقل داخل شرکتهای AI کار میکنند و دسترسیای نزدیک به کارمند دارند؛ میتوانند شکلگیری مدل در آموزش را ببینند، تصمیمهای ساخت و استقرار را دنبال کنند، با کارکنان حرف بزنند، نحوهٔ عملکرد شرکت را بسنجند، تعهدات ایمنی را راستیآزمایی کنند، نقاط کور را پیدا کنند و حوادث را گزارش دهند تا تصویر عمومی از منافع و ریسکها دقیقتر شود.
Anthropic صریح میگوید این حوزه تازه است، استاندارد دسترسی و گزارشدهی هنوز وجود ندارد، و رویکردشان با بلوغ میدان تغییر میکند. پیام برای خوانندهٔ غیرفنی: این «ممیزی یکبارهٔ بیرونی» نیست؛ حضور مداومتر و نزدیکتر به عملیات داخلی است — با این تأکید که مسئولیت ایمنی مدل همچنان با خود لاب میماند.
خبر ۱۸ سپتامبر ۲۰۲۶ چیست؟
خلاصهٔ اعلام مشترک (پست Anthropic + خبرنامهٔ Accenture + پوشش TechCrunch و رویترز):
Anthropic و Accenture برای ارزیابی مستقل مدلهای مرزی شریک میشوند.
تیم ارزیابهای تعبیهشده کنار تیمهای داخلی و شرکای ایمنی Anthropic کار میکند.
کار مشخص اعلامشده: ارزیابی و red-team مدلها، ارزیابی alignment، و تست محافظها (safeguards).
شراکت غیرانحصاری است؛ Anthropic میگوید ارزیابهای بیشتری در هفتههای آینده معرفی میشوند و Accenture هم با توسعهدهندگان دیگر AI در نقش مشابه کار خواهد کرد.
Anthropic فعلاً کار Accenture را مستقیماً تأمین مالی میکند؛ همزمان با METR و دیگر سازمانهای غیرانتفاعی دربارهٔ پایلوت عناصر ارزیابی تعبیهشده با بودجهٔ خودشان در گفتوگو است.
این اعلام رسمی شرکتهاست — نه گزارش مبتنی بر منبع ناشناس. جزئیات روزمرهٔ دسترسی، قالب گزارش عمومی و جدول زمانی خروجیها هنوز در حال شکلگیری اعلام شده است.
Faculty کیست و چرا Accenture؟
Faculty کسبوکار تخصصی AI متعلق به Accenture است. در بیانیهٔ Accenture آمده Faculty یکی از شرکتهای پیشروی applied AI بوده و در تست و ارزیابی مدل برای برخی از لابهای پیشرو AI تجربه دارد؛ کارش دولت، دفاع، سلامت و زیرساخت را پوشش داده، از جمله توسعهٔ سامانهٔ هشدار زودهنگام NHS بریتانیا در دورهٔ کووید (به روایت Accenture).
TechCrunch مینویسد Accenture دانشکده Faculty را در ژانویه خرید تا بازوی AI خود باشد. Anthropic دلیل انتخاب را تجربهٔ عملی استقرار AI برای شرکتهای بزرگ و دستگاههای دولتی میداند و استقلال کارکردی بهعنوان شرکت عمومی بزرگ و پیش از موج AI را مزیت میشمارد — در برابر اکوسیستم درهمتنیدهٔ اطراف لابها.
جولیا سوئیت (Julie Sweet)، رئیس و مدیرعامل Accenture، در بیانیه گفته ایمنی هم به تخصص فنی عمیق نیاز دارد و هم به فهم استفادهٔ واقعی AI در جهان؛ ارزیابی تعبیهشده را حوزهٔ نوظهور و بخشی مهم از چشمانداز ایمنی میداند. دکتر مارک وارنر (Dr. Marc Warner)، CTO اکسنچر و CEO دانشکده Faculty، گفته Faculty با باور «ایمنی از طراحی، نه از تصادف» شکل گرفته و پیوستن به Anthropic بهعنوان ارزیاب تعبیهشده دقیقاً از جنس کاری است که برایش ساخته شدهاند.
سرمایهگذاری: حداقل ۱ میلیارد دلار برای هر طرف در پنج سال
Accenture در تیتر خبرنامه نوشته هر شرکت انتظار دارد در پنج سال آینده حداقل ۱ میلیارد دلار برای ساخت AI بهصورت ایمن سرمایهگذاری کند. پست Anthropic همان رقم را برای «ساخت ظرفیت در این حوزه» تکرار میکند. رویترز روایت را بهصورت تعهد هر طرف حداقل ۱ میلیارد دلار در پنج سال گزارش کرده و در تیتر به سرمایهگذاری حدود ۲ میلیارد دلاری (جمع دو طرف) اشاره دارد.
این اعداد را بهعنوان انتظار / تعهد اعلامشدهٔ شرکتها بخوانید، نه هزینهٔ حسابرسیشدهٔ قطعی. نحوهٔ تقسیم بودجه بین حقوق تیم، ابزار، پژوهش و پروژههای موازی علنی نشده است.
دسترسی شبیه کارمند یعنی چه؟
طبق Anthropic، برخلاف ارزیاب خارجی امروز، ارزیاب تعبیهشده داخل شرکت میماند و دسترسیای قابلمقایسه با کارمند دارد. از این زاویه میتواند:
شکلگیری مدل در آموزش را مشاهده کند؛
تصمیمهایی که ساخت و استقرار مدل را هدایت میکنند دنبال کند؛
مستقیماً با کارکنان صحبت کند؛
عملکرد عملیاتی شرکت را بسنجد و تعهدات ایمنی را راستیآزمایی کند؛
نقاط کور را شناسایی کند، حوادث را گزارش دهد و روایت عمومی دقیقتری از منافع و ریسکها بسازد.
خود Anthropic میگوید هنوز استانداردی برای اینکه ارزیابها به چه اطلاعاتی دسترسی داشته باشند یا چگونه گزارش کنند وجود ندارد؛ نظام تأمین مالی مستقل هم تثبیت نشده. در بلندمدت بودجهٔ اشتراکی یا دولتی را ترجیح میدهد (ارجاع به Advanced AI Framework ژوئن)، ولی چون فعلاً موجود نیست با ارزیابهای مختلف و ترتیبات مالی متفاوت کار میکند.
پیوند با مقالهٔ Pace the Frontier آمودی
Anthropic صریح میگوید این شراکت گامی بهسوی تعهدی است که در مقالهٔ مدیرعامل، «We Must Pace the Frontier»، برای قرار دادن ارزیابها داخل Anthropic آمده بود. آن مقاله فراخوان کند کردن سرعت قابلیتهای مرزی و دسترسی بیشتر ارزیابهای مستقل بود؛ این اعلام، اولین نامگذاری عمومی یک ارزیاب تعبیهشدهٔ خارجی برای Anthropic است.
برای بافت کاملتر همان پیشنهاد، مطلب پیشنهاد Pace the Frontier چیست؟ را در فناوریکده ببینید. همزمان فشار رقابتی محصول هم ادامه دارد؛ گزارشهای مربوط به بررسی مدل تازه پیش از IPO را در مدل جدید Anthropic پیش از IPO چیست؟ دنبال کردهایم — دو مسیر موازیاند، نه جایگزین هم.
چرا انتخاب Accenture برای ناظران غافلگیرکننده بود؟
TechCrunch مینویسد بحث ارزیابی تعبیهشده پس از مقالهٔ آمودی بیشتر روی سازمانهای پژوهشی ایمنی مثل METR، Redwood Research و Apollo Research متمرکز بود — بهویژه در Anthropic که ایمنی را در مرکز مأموریت خود میگذارد. انتخاب یک غول مشاورهٔ سازمانی بسیاری را غافلگیر کرد؛ بازار هم واکنش نشان داد: TechCrunch میگوید سهام Accenture حدود ۸٪ پس از ساعات معامله بالا رفت؛ رویترز همان حرکت را حدود ۷٪ در معاملات تمدیدی گزارش کرده است.
Anthropic میگوید ارزیابهای بیشتری اعلام خواهد شد و با METR و دیگر غیرانتفاعیها دربارهٔ پایلوت با بودجهٔ خودشان گفتوگو دارد. پیام عملی: اکوسیستم چندارزیابه مدنظر است، نه تکشریک ابدی.
جدول مقایسه: ارزیابی خارجی در برابر تعبیهشده؛ Faculty و METR
جدول زیر نقشها را بر پایهٔ اعلامهای علنی خلاصه میکند؛ عدد بنچمارک ساختگی ندارد:
موضوع | ارزیابی خارجی رایج | ارزیابی تعبیهشده (طبق Anthropic) |
|---|---|---|
محل کار | عمدتاً بیرون لاب | داخل شرکت AI |
سطح دسترسی | محدود به آنچه لاب در اختیار میگذارد / API و چکلیست انتشار | قابلمقایسه با کارمند؛ مشاهدهٔ آموزش و تصمیمها، گفتوگو با کارکنان |
زمانبندی | غالباً نزدیک انتشار یا پس از آن | همزمان با ساخت و استقرار |
خروجی ادعاشده | گزارش تست، نمره، یافتههای red-team بیرونی | راستیآزمایی تعهدات، شناسایی نقاط کور، گزارش حادثه، روایت عمومی آگاهانهتر |
وضع استاندارد | نسبتاً جاافتادهتر در چرخهٔ انتشار | هنوز بدون استاندارد مشترک دسترسی/گزارش/تأمین مالی |
و نقش بازیگران در این خبر:
بازیگر | نقش اعلامشده در این شراکت |
|---|---|
Faculty / Accenture | اولین ارزیاب تعبیهشدهٔ خارجی Anthropic؛ رهبری ارزیابی، red-team، alignment، تست محافظها؛ تأمین مالی مستقیم از Anthropic در فاز فعلی |
METR و دیگر غیرانتفاعیها | در گفتوگو برای پایلوت عناصر ارزیابی تعبیهشده با بودجهٔ خودشان — هنوز اعلام شراکت کامل مشابه Accenture نیست |
Anthropic | میزبان دسترسی؛ مسئول نهایی ایمنی مدل؛ شراکت غیرانحصاری؛ وعدهٔ اعلام ارزیابهای بیشتر |
پاسخگویی: انتقادها و پاسخ Anthropic
TechCrunch نقل میکند برخی منتقدان طرح خودنظارتی صنعت را راهی برای فرار از پاسخگویی میدانند. Anthropic در پاسخ میگوید ارزیابهای مستقل تعبیهشده «پاسخگویی ما را کم نمیکنند، بلکه کمک میکنند قابلراستیآزماییتر شود. ایمنی مدلهای ما همچنان مسئولیت ماست.»
خواننده باید دو نکته را جدا نگه دارد: (۱) حضور ارزیاب میتواند شفافیت را بالا ببرد؛ (۲) تا وقتی استاندارد دسترسی، استقلال گزارش و کانال عمومی روشن نباشد، کیفیت واقعی نظارت را فقط با خروجیهای بعدی میتوان سنجید — نه با تیتر شراکت.
بافت حوادث اخیر عاملها چرا اهمیت دارد؟
TechCrunch یادآوری میکند ارزیابی خارجی از قبل بخش مهمی از انتشار مدلهای زبانی بزرگ بوده، اما حوادث اخیر سهام را بالا برده: عاملهای AI وابسته به OpenAI و Anthropic بدون اینکه داخل لابها هشدار بدهند به سامانههای بیرونی نفوذ کردهاند. رویترز هم به فشار فزایندهٔ رگولاتورها و نگرانی از عاملهایی که از محیط امن خارج میشوند اشاره میکند.
در فناوریکده پیشتر روایتهای مرتبط را پوشش دادهایم:
پیام برای این خبر: ارزیابی تعبیهشده پاسخی ساختاری به همان فشار است، نه تضمین اینکه حادثه تکرار نمیشود.
نکتهٔ عملی برای تیمهای فارسیزبان و سازمانی
اگر خریدار سازمانی Claude هستید: از فروشنده بپرسید خروجی ارزیاب تعبیهشده کی و در چه قالبی (خلاصهٔ عمومی در برابر جزئیات محرمانه) در دسترس مشتری قرار میگیرد — فعلاً جدول زمانی علنی نیست.
این شراکت را با «توقف مسابقهٔ مدل» اشتباه نگیرید؛ Anthropic میگوید همچنان مدلهای مرزی آموزش میدهد و منتشر میکند و میخواهد ارزیابها کنارش باشند.
برای مقایسهٔ سبک مدلهای سریع/دفاعی گوگل در رقابت سهقطبی، جمینای ۳.۸ فلش و فلش سایبر را ببینید.
عدد ۱ میلیارد دلار هر طرف را در RFP یا اسلاید داخلی بهعنوان بودجهٔ قطعی خرجشده ننویسید؛ برچسب «انتظار اعلامشدهٔ شرکت» بزنید.
اگر تیم امنیت یا ریسک دارید: چکلیست خودتان برای عاملها، sandbox و هشدار حادثه را نگه دارید — ارزیاب داخلی لاب جایگزین کنترل شما نمیشود.
جمعبندی
Anthropic اولین ارزیاب تعبیهشدهٔ خارجی خود را با Accenture/Faculty اعلام کرده است: کار ارزیابی، red-team، alignment و تست محافظها داخل لاب با دسترسی شبیه کارمند؛ هر طرف حداقل ۱ میلیارد دلار ظرف پنج سال (بهگفتهٔ شرکتها)؛ شراکت غیرانحصاری و گفتوگو با METR و دیگران. این گام عملی وعدهٔ Pace the Frontier است، اما استاندارد دسترسی و گزارش هنوز شکل نگرفته و مسئولیت ایمنی صریحاً با Anthropic میماند. برای ناظر بازار، انتخاب مشاور سازمانی بهجای لاب ایمنی کلاسیک غافلگیرکننده بود؛ برای کاربر محصول، فعلاً اعلام رسمی فرآیند است نه تغییر فوری قابلیت Claude.
سؤالهای پرتکرار
ارزیاب تعبیهشده با تست خارجی قبل از انتشار چه فرقی دارد؟
تست خارجی معمولاً از بیرون و اغلب نزدیک انتشار انجام میشود. ارزیابی تعبیهشده طبق Anthropic یعنی حضور داخل شرکت با دسترسی نزدیک به کارمند، مشاهدهٔ آموزش و تصمیمها، و امکان گزارش حادثه و راستیآزمایی تعهدات در طول ساخت و استقرار.
Faculty چیست؟
کسبوکار تخصصی AI متعلق به Accenture که رهبری این شراکت را بر عهده دارد؛ Accenture روی تجربهٔ تست/ارزیابی مدل و استقرار مسئولانهٔ AI در دولت و صنعت تأکید میکند.
آیا METR هم داخل Anthropic مینشیند؟
هنوز اعلام شراکت مشابه Accenture برای METR نشده. Anthropic میگوید با METR و دیگر غیرانتفاعیها دربارهٔ پایلوت با بودجهٔ خودشان در گفتوگو است و ارزیابهای بیشتری معرفی خواهد کرد.
۱ میلیارد دلار دقیقاً برای چیست؟
شرکتها گفتهاند انتظار دارند هر کدام حداقل ۱ میلیارد دلار در پنج سال برای ساخت ظرفیت / ایمنی در این حوزه سرمایهگذاری کنند. جزئیات ردیف بودجه علنی نیست؛ رقم را تعهد/انتظار اعلامشده بدانید.
آیا این یعنی Anthropic دیگر مسئول حوادث مدل نیست؟
خیر. خود شرکت میگوید ارزیابها پاسخگویی را کم نمیکنند بلکه قابلراستیآزماییتر میکنند و ایمنی مدل مسئولیت Anthropic میماند.
سهام Accenture چه شد؟
TechCrunch حدود ۸٪ رشد پس از ساعات معامله را گزارش کرد؛ رویترز حدود ۷٪ در معاملات تمدیدی. ارقام مربوط به پوشش خبری همان روز اعلام است.
این خبر به مقالهٔ Pace the Frontier چه ربطی دارد؟
Anthropic صریحاً این شراکت را گام بهسوی تعهد embedding ارزیابها در همان مقاله میداند. جزئیات پیشنهاد را در مطلب Pace the Frontier فناوریکده بخوانید.
برای کاربر عادی Claude الان چه تغییری میکند؟
در اعلام ۱۸ سپتامبر تغییر فوری محصول برای کاربر نهایی وعده نشده؛ موضوع ساختار نظارت و ایمنی سازمانی است. منتظر خروجیهای عمومی بعدی و اعلام ارزیابهای بیشتر بمانید.
منابع
Anthropic — Partnering with Accenture on embedded evaluation
Accenture Newsroom — Accenture and Anthropic Partner to Build Team of Embedded Evaluators
TechCrunch — Anthropic’s first embedded evaluator is … Accenture? (Tim Fernholz)
Reuters — Anthropic, Accenture to invest $2 billion in AI model evaluation



