درس سری همیشه به‌روز دربارهٔ طبقه‌بندی متن با هوش مصنوعی

طبقه‌بندی متن در مقیاس؛ از ۷۰ درصد دقت تا ۹۷ درصد بدون آموزش مدل

⏱ زمان مطالعه: حدود ۹ دقیقه✏️ تمرین دارد🎯 سطح: میانی

تصور کن مسئول پشتیبانی یک شرکت بیمهٔ ایرانی هستی و هر روز صبح حدود دو هزار پیام تازه در صندوق تیکت‌ها نشسته است. بعضی‌ها می‌پرسند «چرا حق بیمهٔ امسالم بیشتر شده؟»، بعضی می‌گویند «این جریمهٔ تأخیر اشتباه است، پس بگیرید»، بعضی می‌خواهند نام راننده را در بیمه‌نامه عوض کنند و بعضی هم تازه تصادف کرده‌اند و دنبال پروندهٔ خسارت‌اند. تا وقتی این پیام‌ها دسته‌بندی نشوند، همه در یک صف می‌مانند و کسی که ماشینش کف خیابان است، پشت سرِ کسی می‌ایستد که فقط یک سؤال ساده دربارهٔ تاریخ سررسید دارد.

دسته‌بندی، قدیمی‌ترین و پرکاربردترین کار زبانی در هر کسب‌وکاری است. روش سنتی‌اش این بود که چند هزار نمونه برچسب بزنی، یک مدل یادگیری ماشین آموزش بدهی و هر بار که دسته‌ها عوض شد، از نو شروع کنی. راهنمای رسمی آنتروپیک نشان می‌دهد که امروز می‌شود بدون هیچ آموزشی و فقط با سه لایه پرامپت، از دقت هفتاد درصد به نود و هفت درصد رسید. این درس، همان مسیر سه‌مرحله‌ای است.

آنچه در این درس یاد می‌گیرید

  • چرا تعریفِ دقیقِ دسته‌ها مهم‌تر از پرامپت‌نویسی هوشمندانه است
  • ساخت یک طبقه‌بند سادهٔ قابل اتکا با برچسب‌های ساخت‌یافته و پیش‌پرکردن پاسخ
  • افزودن مثال‌های مشابه با جست‌وجوی معنایی و جهش دقت به نود و چهار درصد
  • افزودن دفترچهٔ فکر برای حل پرونده‌های مرزی و رسیدن به نود و هفت درصد
  • اندازه‌گیری واقعی با ماتریس درهم‌ریختگی به‌جای حدس زدن کیفیت

گام صفر: دسته‌ها را طوری بنویس که خودت هم قانع شوی

بیشترِ شکست‌های دسته‌بندی، ریشهٔ فنی ندارند؛ ریشه‌شان این است که دو دستهٔ همسایه هیچ‌وقت با دقت از هم جدا نشده‌اند. اگر تو نتوانی در سه خط توضیح بدهی که «پرسش صورت‌حساب» با «اعتراض صورت‌حساب» چه فرقی دارد، مدل هم نمی‌تواند. پس اولین کار، نوشتن یک فهرست ساخت‌یافته است که هر دسته در آن یک برچسب دارد و چند نمونهٔ مشخص:

<categories>
<category>
<label>پرسش صورت‌حساب</label>
<content>
پرسش دربارهٔ مبلغ فاکتور، حق بیمه و کارمزدها
درخواست توضیح دربارهٔ اقلام صورت‌حساب
پرسش دربارهٔ روش‌های پرداخت و تاریخ سررسید
</content>
</category>
<category>
<label>اعتراض صورت‌حساب</label>
<content>
شکایت از مبلغ غیرمنتظره یا نادرست
درخواست بازگشت وجه یا اصلاح حق بیمه
اعتراض به جریمهٔ تأخیر و اخطار وصول
</content>
</category>
</categories>

دقت کن که تفاوت این دو دسته در «لحن» نیست، در «خواسته» است: یکی توضیح می‌خواهد، دیگری تغییرِ مبلغ. همین یک جمله را وقتی به تعریف اضافه کنی، ده‌ها خطای بعدی را از بین برده‌ای. برچسب‌گذاری با تگ‌های زاویه‌دار هم تصادفی نیست؛ همان‌طور که در فرمول چهاربخشی پرامپت دیدیم، مرزبندی روشنِ بخش‌ها به مدل کمک می‌کند بفهمد کجا داده است و کجا دستور.

لایهٔ اول: طبقه‌بند ساده و سقف هفتاد درصد

ساده‌ترین شکل کار این است که تعریف دسته‌ها و متن تیکت را کنار هم بگذاری و فقط برچسب بخواهی. دو نکتهٔ مهندسی اینجا تفاوت میان یک نمونهٔ آزمایشی و یک سامانهٔ قابل اتکا را می‌سازد: پیش‌پرکردنِ پاسخ و توالی توقف.

تا اینجا مقدمه بود. بخش اصلی این درس — نمونه‌ها، پرامپت‌های آماده و تمرین‌ها — برای اعضای ویژه باز می‌شود.

🔒

طبقه‌بندی متن در مقیاس؛ از ۷۰ درصد دقت تا ۹۷ درصد بدون آموزش مدل

برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.

🎁 ورود / ثبت‌نام و شروع ۱۴ روز رایگان
قبلاً عضو شده‌ای؟ فقط کافی است وارد شوی. اشتراک: از ۱۹۹٬۰۰۰ تومان / ماه
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *