فهرست مطالب
LangSmith Fine-Tuning ابزار جدید لنگچین است که با CLI بهنام smithtune مسیر کامل یک ایجنت (trajectory) ذخیرهشده در LangSmith را به یک مدل تنظیمدقیقشده (fine-tuned) تبدیل میکند: از آمادهسازی دیتاست تا آموزش روی Fireworks یا Baseten و برگرداندن نتیجهٔ ارزیابی به LangSmith. خبر رسمی حدود ۲۴ سپتامبر ۲۰۲۶ در بلاگ لنگچین آمد (نویسندگان Ankush Gola، Jake Broekhuizen و Vivek Trivedy) و فردای آن در جمعبندی Interrupt NYC دوباره برجسته شد. وضعیت فعلی: بتای عمومی.
اگر با ایجنتهای کدنویسی مثل Claude Code یا Cursor کار میکنید و ردپای اجرا را در LangSmith نگه میدارید، ایده ساده است: بهجای اینکه فقط پرامپت و harness را دستکاری کنید، نمونههای خوب اجرا را به وزنهای یک مدل باز تبدیل کنید — اغلب ارزانتر و کمتأخیرتر از مدل مرزی عمومی برای همان کار تکراری. در ادامه میگوییم fine-tuning و trajectory یعنی چه، smithtune چه مراحلی دارد، چه زمانی به درد میخورد، و محدودیتها چیست.
زمینه کوتاه: fine-tuning و trajectory یعنی چه؟
تنظیم دقیق مدل (fine-tuning) یعنی روی یک مدل ازپیشآموزشدیده، با مثالهای خودتان دوباره آموزش کوتاه میدهید تا رفتار مشخصی را یاد بگیرد. نوع پشتیبانیشده در smithtune الان SFT یا supervised fine-tuning است: ورودی/خروجی (و فراخوانی ابزار) خوب را نشان میدهید؛ مدل وزنها را طوری عوض میکند که آن رفتار را تقلید کند.
Trajectory یا مسیر کامل اجرا، دنبالهٔ مرتب پیامها، فراخوانی ابزار و نتیجهٔ ابزار است که نشان میدهد ایجنت چطور یک کار را جلو برده. LangSmith این مسیر را از trace یا thread میسازد، قالب پیامها را یکدست میکند، تعریف ابزارها را نگه میدارد و — نکتهٔ مهم برای آموزش — دقیقاً ثبت میکند مدل در هر نوبت چه چیزی دیده؛ چون در ایجنتهای بلند، فهرست ابزارهای در دسترس وسط کار عوض میشود و export خام پیامهای نهایی آن nuance را از دست میدهد.
خبر ۲۴–۲۵ سپتامبر ۲۰۲۶ چه بود؟
لنگچین گفت تیمها دیگر مجبور نیستند پایپلاین دادهٔ fine-tuning را از صفر بسازند. smithtune از یک CLI (یا با skill مخصوص coding agent) این حلقه را جمع میکند:
ساخت و آمادهسازی دیتاست از trajectoryهای LangSmith
آموزش با Fireworks (managed SFT) یا Baseten Loops (آموزش LoRA روی GPU مدیریتشده)
ارزیابی و مقایسهٔ مدل پایه در برابر مدل تنظیمشده داخل LangSmith
اختیاری: deploy مدل تنظیمشده و اتصال به اپلیکیشن
شریکها در بلاگ نقلقول دادند: Fireworks روی مسیر «از trace تولید تا مدل سروشده» تأکید کرد؛ Baseten روی یکپارچگی با Loops برای آزمایش سریع fine-tuning. کد باز در GitHub بهآدرس langchain-ai/smithtune است؛ مستندات رسمی هم در docs.langchain.com/langsmith/smithtune آمده است.
جدول مسیر کار smithtune
خلاصهٔ مراحل طبق بلاگ و مستندات (نام دستورها را بهصورت متن ساده مینویسیم تا در ادیتور سایت خراب نشوند):
مرحله | چه میکند | خروجی عملی |
|---|---|---|
ساخت دیتاست | کشیدن trajectory از پروژهٔ tracing، برچسبزنی/فیلتر نمونههای خوب، آپلود مجموعهٔ پایدار | دیتاست golden در LangSmith + split آموزش/اعتبارسنجی/تست |
plan | مرور مدل انتخابی، تعداد مثال، نرخ یادگیری، batch، epoch قبل از هزینهٔ آموزش | تنظیمات قابلویرایش قبل از train |
train | ارسال job به Fireworks یا Baseten Loops؛ انتخاب چکپوینت با کمترین validation loss | مدل/چکپوینت تنظیمشده بدون GPU خودتان |
evaluate | مقایسهٔ مدل پایه و تنظیمشده با replay روی trajectoryهای کنارگذاشتهشده | لینک مقایسه در LangSmith؛ امتیاز قاضی روی شباهت به رفتار ثبتشده |
deploy (اختیاری) | سرو کردن مدل تنظیمشده و اتصال به اپ | اندپوینت برای استفاده در پروداکشن |
از دیتاست تا آموزش — جزئیات کاربردی
طبق بلاگ، برای دیتاست چند کار تکراری انجام میشود:
Pull: trajectoryها را از پروژهٔ tracing به پوشهٔ محلی میکشد (با فیلتر اختیاری).
Label: با انسان (و ایجنتهای کمکی) ویژگی «ردپای خوب» را تعریف میکند، روبریک میسازد، بعد شورای ایجنتها برای مرور و فیلتر کاندیداهای SFT کمک میکند.
Store: مجموعهٔ توافقشده را بهصورت artifact پایدار در دیتاست LangSmith نگه میدارد تا بعداً قابلحسابرسی باشد.
trajectoryهایی که از سقف طول توالی مدل هدف بیشترند فیلتر میشوند؛ داده به train/val/test تقسیم میشود.
قبل از هزینهکردن GPU ابری، smithtune plan تنظیمات را نشان میدهد. بعد train جاب را به Fireworks یا Baseten میفرستد — نیازی به provision کردن GPU خودتان نیست. برای شروع رسمی، مستندات میگوید smithtune و LangSmith CLI را نصب کنید، کلیدها را بگذارید، حق داده را با acknowledge-data-rights بپذیرید و با doctor وضعیت محیط را چک کنید.
ارزیابی را چطور بخوانیم؟
بعد از آموزش، evaluate مدل پایه و مدل جدید را روی split تست مقایسه میکند. سازوکار اعلامشده: replay — مدل باید بتواند اکشنهای مسیر طلایی را کامل کند و یک قاضی، پیشبینی را با مثال ثبتشده امتیاز میدهد. نتایج همزمان در LangSmith دیده میشوند.
نکتهٔ مهم مستندات: این امتیازها میسنجند مدل چقدر به رفتار ضبطشده نزدیک است؛ smithtune ابزارهایی را که مدل پیشنهاد میدهد واقعاً اجرا نمیکند و «موفقیت انتهابهانتهای تسک» را تضمین نمیکند. اگر نتیجه ضعیف بود، معمولاً باید دیتاست یا هایپرپارامتر را اصلاح کنید و دوباره train/evaluate بزنید — نه اینکه فقط یک بار اجرا کنید و رها کنید.
نتایج داخلی لنگچین — با احتیاط
لنگچین smithtune را روی دو ایجنت پرترافیک خودش آزمود. اعداد زیر اعلام شرکتاند، نه آزمون مستقل ما:
Engine (تشخیص و گروهبندی مسئله در trace): روی زیرمجموعهای از IssueBench، GPT-5.6 Sol امتیاز ۸۷٫۰، Kimi K3 پایه ۹۰٫۰، و Kimi K3 با SFT ۹۶٫۰.
OpenSWE Review (بازبینی PR): روی Qwen-3.8-27B، F1 از ۴۸٫۹٪ به ۵۳٫۷٪؛ همزمان حدود ۲۹٫۸٪ فراخوانی مدل کمتر و ۲۹٫۴٪ درخواست ابزار کمتر. یک دیتاست کمگزینشتر قبلاً F1 را بعد از SFT بدتر کرده بود — تا وقتی مرحلهٔ مرور دقیقتر روی trace اضافه شد.
پیام عملی خود لنگچین: بیشترین سود fine-tuning از انتخاب داده میآید، نه فقط زدن دکمهٔ train. اول harness engineering را جدی بگیرید؛ اگر ایجنت هنوز روی کارهای تکراری اشتباه ثابت دارد و trajectory درست دارید، آن وقت SFT کاندیدای خوبی است.
کنار این خبر: Engine و Trajectories
همان هفته لنگچین چند قطعهٔ مرتبط را هم اعلام کرد که موضوع اصلی این مطلب نیستند، ولی حلقهٔ بهبود ایجنت را کامل میکنند:
LangSmith Trajectories: نمای مکالمهمانند از session برای دیباگ و مرور متخصص حوزه بدون غرقشدن در متادیتای اجرا.
Engine v2: ایجنت داخل پلتفرم برای تشخیص مسئله، red teaming و حتی آزمایش خودکار فیکسها (از زمان لانچ می، بیش از ۶۰ میلیون trace تحلیل شده — اعلام لنگچین).
Managed Deep Agents v0.8: حافظه در سطح کاربر، کانالها و جستجوی وب توکار.
Fine-Tuning قطعهٔ «از دادهٔ تولید به مدل اختصاصی» است؛ بقیه بیشتر مشاهدهپذیری و runtimeاند. برای محیط امن اجرای ایجنت کدنویسی در کلود، مطلب Docker Cloud Sandboxes را هم ببینید؛ برای عامل چندمرحلهٔ محصولی، بررسی ChatGPT Work و برای CLI کدنویسی باز، Minimax Code CLI مرتبطاند.
این ابزار برای چه کسی مناسب است؟
تیم ایجنت در پروداکشن که از قبل در LangSmith تریس میگیرد و کارهای تکراری با الگوی مشخص دارد.
تیمهایی که harness را تا ته کشیدهاند و هنوز اشتباه ثابت میبینند، ولی نمونهٔ مسیر درست دارند.
کسانی که میخواهند مدل باز تخصصی با هزینه/تأخیر کمتر بهجای مدل مرزی عمومی برای همان تسک.
کمتر مناسب اگر: هنوز tracing مرتب ندارید؛ دادهٔ «خوب» ندارید؛ یا فقط یکبار میخواهید مدل را fine-tune کنید بدون بودجهٔ Fireworks/Baseten و بدون حوصلهٔ curation.
جمعبندی
LangSmith Fine-Tuning با smithtune حلقهٔ «مسیر ایجنت → دیتاست → آموزش ابری → ارزیابی در LangSmith → استقرار اختیاری» را در بتای عمومی جمع کرده است. ارزش واقعیاش وقتی است که trajectoryهای باکیفیت و curation جدی داشته باشید؛ عددهای بنچمارک داخلی را سیگنال ببینید، نه ضمانت. اگر ایجنت تکراری میسازید و ردپا را دارید، الان وقت آزمایش کوچک روی یک تسک مشخص است — نه مهاجرت ناگهانی همهٔ ترافیک.
سؤالات پرتکرار
LangSmith Fine-Tuning چیست؟
قابلیت لنگچین (بتای عمومی، حدود ۲۴ سپتامبر ۲۰۲۶) برای تبدیل trajectoryهای ایجنت در LangSmith به مدل تنظیمدقیقشدهٔ باز، از طریق CLI بهنام smithtune و آموزش روی Fireworks یا Baseten.
smithtune دقیقاً چه کاری میکند؟
دیتاست را از مسیرهای اجرا میسازد و آماده میکند، آموزش را به Fireworks یا Baseten Loops میسپارد، ارزیابی را به LangSmith برمیگرداند و در صورت تمایل مدل را deploy میکند.
trajectory با trace معمولی چه فرقی دارد؟
Trajectory نمای مرتب و آموزشپسند از پیامها و ابزارهاست که زمینهٔ واقعی هر نوبت مدل را نگه میدارد؛ برای SFT مهم است چون مدل دانشجو باید همان چیزی را ببیند که مدل معلم هنگام موفقیت دیده بود.
آیا به GPU خودم نیاز دارم؟
طبق اعلام لنگچین، آموزش مدیریتشده روی Fireworks یا Baseten است و شما GPU محلی provision نمیکنید؛ البته هزینهٔ همان سرویسها و کلید API لازم است.
SFT برای چه کاری بهتر جواب میدهد؟
کارهای تکراری با الگوی ثابت: پیروی از workflow، تصمیم بعدی از روی نتیجهٔ ابزار، و چککردن کار. اگر هنوز با بهبود harness جلو میروید، اول همان را تمام کنید.
آیا بنچمارک Engine و OpenSWE تضمین محصول من است؟
خیر. آنها نتایج داخلی لنگچین روی ایجنتهای خودشاناند. برای محصول شما فقط ارزیابی روی دیتاست خودتان معیار است.
ارزیابی smithtune موفقیت تسک را کامل میسنجد؟
طبق مستندات، امتیازها نزدیکی به رفتار ضبطشده را میسنجند؛ ابزارهای پیشنهادی مدل اجرا نمیشوند. برای اطمینان پروداکشن، تست انتهابهانتها جدا لازم است.
از کجا شروع کنم؟
حساب LangSmith با trace، کلید Fireworks یا Baseten، نصب smithtune از GitHub/مستندات، acknowledge-data-rights، doctor، بعد یک دیتاست کوچک از trajectoryهای واقعاً خوب.
منابع
LangChain Blog — Introducing LangSmith Fine-Tuning (۲۴ سپتامبر ۲۰۲۶)
LangChain Blog — Engine v2, Managed Deep Agents, Fine-Tuning, Trajectories (۲۵ سپتامبر ۲۰۲۶)
Baseten Blog — Fine-tune on LangSmith traces with Loops (۲۴ سپتامبر ۲۰۲۶)



