پرش به محتوای اصلی
ابزارهای هوش مصنوعی

LangSmith Fine-Tuning چیست؟ از مسیر ایجنت تا مدل با smithtune

LangSmith Fine-Tuning با CLI اسمیت‌تیون مسیر ایجنت را به مدل تنظیم‌دقیق تبدیل می‌کند؛ دیتاست، Fireworks یا Baseten، ارزیابی در LangSmith — بتای ۲۴ سپتامبر ۲۰۲۶.

۹ دقیقه مطالعه
اشتراک‌گذاری:
LangSmith Fine-Tuning چیست؟ از مسیر ایجنت تا مدل با smithtune
فهرست مطالب

LangSmith Fine-Tuning ابزار جدید لنگ‌چین است که با CLI به‌نام smithtune مسیر کامل یک ایجنت (trajectory) ذخیره‌شده در LangSmith را به یک مدل تنظیم‌دقیق‌شده (fine-tuned) تبدیل می‌کند: از آماده‌سازی دیتاست تا آموزش روی Fireworks یا Baseten و برگرداندن نتیجهٔ ارزیابی به LangSmith. خبر رسمی حدود ۲۴ سپتامبر ۲۰۲۶ در بلاگ لنگ‌چین آمد (نویسندگان Ankush Gola، Jake Broekhuizen و Vivek Trivedy) و فردای آن در جمع‌بندی Interrupt NYC دوباره برجسته شد. وضعیت فعلی: بتای عمومی.

اگر با ایجنت‌های کدنویسی مثل Claude Code یا Cursor کار می‌کنید و ردپای اجرا را در LangSmith نگه می‌دارید، ایده ساده است: به‌جای این‌که فقط پرامپت و harness را دست‌کاری کنید، نمونه‌های خوب اجرا را به وزن‌های یک مدل باز تبدیل کنید — اغلب ارزان‌تر و کم‌تأخیرتر از مدل مرزی عمومی برای همان کار تکراری. در ادامه می‌گوییم fine-tuning و trajectory یعنی چه، smithtune چه مراحلی دارد، چه زمانی به درد می‌خورد، و محدودیت‌ها چیست.

زمینه کوتاه: fine-tuning و trajectory یعنی چه؟

تنظیم دقیق مدل (fine-tuning) یعنی روی یک مدل ازپیش‌آموزش‌دیده، با مثال‌های خودتان دوباره آموزش کوتاه می‌دهید تا رفتار مشخصی را یاد بگیرد. نوع پشتیبانی‌شده در smithtune الان SFT یا supervised fine-tuning است: ورودی/خروجی (و فراخوانی ابزار) خوب را نشان می‌دهید؛ مدل وزن‌ها را طوری عوض می‌کند که آن رفتار را تقلید کند.

Trajectory یا مسیر کامل اجرا، دنبالهٔ مرتب پیام‌ها، فراخوانی ابزار و نتیجهٔ ابزار است که نشان می‌دهد ایجنت چطور یک کار را جلو برده. LangSmith این مسیر را از trace یا thread می‌سازد، قالب پیام‌ها را یکدست می‌کند، تعریف ابزارها را نگه می‌دارد و — نکتهٔ مهم برای آموزش — دقیقاً ثبت می‌کند مدل در هر نوبت چه چیزی دیده؛ چون در ایجنت‌های بلند، فهرست ابزارهای در دسترس وسط کار عوض می‌شود و export خام پیام‌های نهایی آن nuance را از دست می‌دهد.

خبر ۲۴–۲۵ سپتامبر ۲۰۲۶ چه بود؟

لنگ‌چین گفت تیم‌ها دیگر مجبور نیستند پایپ‌لاین دادهٔ fine-tuning را از صفر بسازند. smithtune از یک CLI (یا با skill مخصوص coding agent) این حلقه را جمع می‌کند:

  • ساخت و آماده‌سازی دیتاست از trajectoryهای LangSmith

  • آموزش با Fireworks (managed SFT) یا Baseten Loops (آموزش LoRA روی GPU مدیریت‌شده)

  • ارزیابی و مقایسهٔ مدل پایه در برابر مدل تنظیم‌شده داخل LangSmith

  • اختیاری: deploy مدل تنظیم‌شده و اتصال به اپلیکیشن

شریک‌ها در بلاگ نقل‌قول دادند: Fireworks روی مسیر «از trace تولید تا مدل سرو‌شده» تأکید کرد؛ Baseten روی یکپارچگی با Loops برای آزمایش سریع fine-tuning. کد باز در GitHub به‌آدرس langchain-ai/smithtune است؛ مستندات رسمی هم در docs.langchain.com/langsmith/smithtune آمده است.

جدول مسیر کار smithtune

خلاصهٔ مراحل طبق بلاگ و مستندات (نام دستورها را به‌صورت متن ساده می‌نویسیم تا در ادیتور سایت خراب نشوند):

مرحله

چه می‌کند

خروجی عملی

ساخت دیتاست

کشیدن trajectory از پروژهٔ tracing، برچسب‌زنی/فیلتر نمونه‌های خوب، آپلود مجموعهٔ پایدار

دیتاست golden در LangSmith + split آموزش/اعتبارسنجی/تست

plan

مرور مدل انتخابی، تعداد مثال، نرخ یادگیری، batch، epoch قبل از هزینهٔ آموزش

تنظیمات قابل‌ویرایش قبل از train

train

ارسال job به Fireworks یا Baseten Loops؛ انتخاب چک‌پوینت با کمترین validation loss

مدل/چک‌پوینت تنظیم‌شده بدون GPU خودتان

evaluate

مقایسهٔ مدل پایه و تنظیم‌شده با replay روی trajectoryهای کنارگذاشته‌شده

لینک مقایسه در LangSmith؛ امتیاز قاضی روی شباهت به رفتار ثبت‌شده

deploy (اختیاری)

سرو کردن مدل تنظیم‌شده و اتصال به اپ

اندپوینت برای استفاده در پروداکشن

از دیتاست تا آموزش — جزئیات کاربردی

طبق بلاگ، برای دیتاست چند کار تکراری انجام می‌شود:

  • Pull: trajectoryها را از پروژهٔ tracing به پوشهٔ محلی می‌کشد (با فیلتر اختیاری).

  • Label: با انسان (و ایجنت‌های کمکی) ویژگی «ردپای خوب» را تعریف می‌کند، روبریک می‌سازد، بعد شورای ایجنت‌ها برای مرور و فیلتر کاندیداهای SFT کمک می‌کند.

  • Store: مجموعهٔ توافق‌شده را به‌صورت artifact پایدار در دیتاست LangSmith نگه می‌دارد تا بعداً قابل‌حسابرسی باشد.

  • trajectoryهایی که از سقف طول توالی مدل هدف بیشترند فیلتر می‌شوند؛ داده به train/val/test تقسیم می‌شود.

قبل از هزینه‌کردن GPU ابری، smithtune plan تنظیمات را نشان می‌دهد. بعد train جاب را به Fireworks یا Baseten می‌فرستد — نیازی به provision کردن GPU خودتان نیست. برای شروع رسمی، مستندات می‌گوید smithtune و LangSmith CLI را نصب کنید، کلیدها را بگذارید، حق داده را با acknowledge-data-rights بپذیرید و با doctor وضعیت محیط را چک کنید.

ارزیابی را چطور بخوانیم؟

بعد از آموزش، evaluate مدل پایه و مدل جدید را روی split تست مقایسه می‌کند. سازوکار اعلام‌شده: replay — مدل باید بتواند اکشن‌های مسیر طلایی را کامل کند و یک قاضی، پیش‌بینی را با مثال ثبت‌شده امتیاز می‌دهد. نتایج هم‌زمان در LangSmith دیده می‌شوند.

نکتهٔ مهم مستندات: این امتیازها می‌سنجند مدل چقدر به رفتار ضبط‌شده نزدیک است؛ smithtune ابزارهایی را که مدل پیشنهاد می‌دهد واقعاً اجرا نمی‌کند و «موفقیت انتهابه‌انتهای تسک» را تضمین نمی‌کند. اگر نتیجه ضعیف بود، معمولاً باید دیتاست یا هایپرپارامتر را اصلاح کنید و دوباره train/evaluate بزنید — نه این‌که فقط یک بار اجرا کنید و رها کنید.

نتایج داخلی لنگ‌چین — با احتیاط

لنگ‌چین smithtune را روی دو ایجنت پرترافیک خودش آزمود. اعداد زیر اعلام شرکتاند، نه آزمون مستقل ما:

  • Engine (تشخیص و گروه‌بندی مسئله در trace): روی زیرمجموعه‌ای از IssueBench، GPT-5.6 Sol امتیاز ۸۷٫۰، Kimi K3 پایه ۹۰٫۰، و Kimi K3 با SFT ۹۶٫۰.

  • OpenSWE Review (بازبینی PR): روی Qwen-3.8-27B، F1 از ۴۸٫۹٪ به ۵۳٫۷٪؛ هم‌زمان حدود ۲۹٫۸٪ فراخوانی مدل کمتر و ۲۹٫۴٪ درخواست ابزار کمتر. یک دیتاست کم‌گزینش‌تر قبلاً F1 را بعد از SFT بدتر کرده بود — تا وقتی مرحلهٔ مرور دقیق‌تر روی trace اضافه شد.

پیام عملی خود لنگ‌چین: بیشترین سود fine-tuning از انتخاب داده می‌آید، نه فقط زدن دکمهٔ train. اول harness engineering را جدی بگیرید؛ اگر ایجنت هنوز روی کارهای تکراری اشتباه ثابت دارد و trajectory درست دارید، آن وقت SFT کاندیدای خوبی است.

کنار این خبر: Engine و Trajectories

همان هفته لنگ‌چین چند قطعهٔ مرتبط را هم اعلام کرد که موضوع اصلی این مطلب نیستند، ولی حلقهٔ بهبود ایجنت را کامل می‌کنند:

  • LangSmith Trajectories: نمای مکالمه‌مانند از session برای دیباگ و مرور متخصص حوزه بدون غرق‌شدن در متادیتای اجرا.

  • Engine v2: ایجنت داخل پلتفرم برای تشخیص مسئله، red teaming و حتی آزمایش خودکار فیکس‌ها (از زمان لانچ می، بیش از ۶۰ میلیون trace تحلیل شده — اعلام لنگ‌چین).

  • Managed Deep Agents v0.8: حافظه در سطح کاربر، کانال‌ها و جستجوی وب توکار.

Fine-Tuning قطعهٔ «از دادهٔ تولید به مدل اختصاصی» است؛ بقیه بیشتر مشاهده‌پذیری و runtimeاند. برای محیط امن اجرای ایجنت کدنویسی در کلود، مطلب Docker Cloud Sandboxes را هم ببینید؛ برای عامل چندمرحلهٔ محصولی، بررسی ChatGPT Work و برای CLI کدنویسی باز، Minimax Code CLI مرتبط‌اند.

این ابزار برای چه کسی مناسب است؟

  • تیم ایجنت در پروداکشن که از قبل در LangSmith تریس می‌گیرد و کارهای تکراری با الگوی مشخص دارد.

  • تیم‌هایی که harness را تا ته کشیده‌اند و هنوز اشتباه ثابت می‌بینند، ولی نمونهٔ مسیر درست دارند.

  • کسانی که می‌خواهند مدل باز تخصصی با هزینه/تأخیر کمتر به‌جای مدل مرزی عمومی برای همان تسک.

  • کمتر مناسب اگر: هنوز tracing مرتب ندارید؛ دادهٔ «خوب» ندارید؛ یا فقط یک‌بار می‌خواهید مدل را fine-tune کنید بدون بودجهٔ Fireworks/Baseten و بدون حوصلهٔ curation.

جمع‌بندی

LangSmith Fine-Tuning با smithtune حلقهٔ «مسیر ایجنت → دیتاست → آموزش ابری → ارزیابی در LangSmith → استقرار اختیاری» را در بتای عمومی جمع کرده است. ارزش واقعی‌اش وقتی است که trajectoryهای باکیفیت و curation جدی داشته باشید؛ عددهای بنچمارک داخلی را سیگنال ببینید، نه ضمانت. اگر ایجنت تکراری می‌سازید و ردپا را دارید، الان وقت آزمایش کوچک روی یک تسک مشخص است — نه مهاجرت ناگهانی همهٔ ترافیک.

سؤالات پرتکرار

LangSmith Fine-Tuning چیست؟

قابلیت لنگ‌چین (بتای عمومی، حدود ۲۴ سپتامبر ۲۰۲۶) برای تبدیل trajectoryهای ایجنت در LangSmith به مدل تنظیم‌دقیق‌شدهٔ باز، از طریق CLI به‌نام smithtune و آموزش روی Fireworks یا Baseten.

smithtune دقیقاً چه کاری می‌کند؟

دیتاست را از مسیرهای اجرا می‌سازد و آماده می‌کند، آموزش را به Fireworks یا Baseten Loops می‌سپارد، ارزیابی را به LangSmith برمی‌گرداند و در صورت تمایل مدل را deploy می‌کند.

trajectory با trace معمولی چه فرقی دارد؟

Trajectory نمای مرتب و آموزش‌پسند از پیام‌ها و ابزارهاست که زمینهٔ واقعی هر نوبت مدل را نگه می‌دارد؛ برای SFT مهم است چون مدل دانشجو باید همان چیزی را ببیند که مدل معلم هنگام موفقیت دیده بود.

آیا به GPU خودم نیاز دارم؟

طبق اعلام لنگ‌چین، آموزش مدیریت‌شده روی Fireworks یا Baseten است و شما GPU محلی provision نمی‌کنید؛ البته هزینهٔ همان سرویس‌ها و کلید API لازم است.

SFT برای چه کاری بهتر جواب می‌دهد؟

کارهای تکراری با الگوی ثابت: پیروی از workflow، تصمیم بعدی از روی نتیجهٔ ابزار، و چک‌کردن کار. اگر هنوز با بهبود harness جلو می‌روید، اول همان را تمام کنید.

آیا بنچمارک Engine و OpenSWE تضمین محصول من است؟

خیر. آن‌ها نتایج داخلی لنگ‌چین روی ایجنت‌های خودشان‌اند. برای محصول شما فقط ارزیابی روی دیتاست خودتان معیار است.

ارزیابی smithtune موفقیت تسک را کامل می‌سنجد؟

طبق مستندات، امتیازها نزدیکی به رفتار ضبط‌شده را می‌سنجند؛ ابزارهای پیشنهادی مدل اجرا نمی‌شوند. برای اطمینان پروداکشن، تست انتهابه‌انتها جدا لازم است.

از کجا شروع کنم؟

حساب LangSmith با trace، کلید Fireworks یا Baseten، نصب smithtune از GitHub/مستندات، acknowledge-data-rights، doctor، بعد یک دیتاست کوچک از trajectoryهای واقعاً خوب.

منابع

برچسب‌ها:مدل زبانی بزرگبرنامه‌نویسیهوش مصنوعیهوش مصنوعی مولد
اشتراک‌گذاری:

مطالب مرتبط

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.