فیلتر نظارت محتوا با کلود؛ از قانون‌نویسی تا تصمیم ALLOW یا BLOCK

یک فروشگاه اینترنتی ایرانی را تصور کن که زیر هر محصول، بخش «دیدگاه کاربران» دارد. روزی هزار نظر ثبت می‌شود و یک کارشناس محتوا باید همه را بخواند تا تبلیغ رقیب، فحاشی، شمارهٔ تلگرام و ادعاهای پزشکی جعلی را حذف کند. تیم فنی سال‌ها با فهرست کلمات ممنوعه جنگیده است: کلمهٔ «کشتن» را بستند، نظر «این گوشی باتری را می‌کشد» هم حذف شد؛ کلمه را باز کردند، تهدید واقعی رد شد. مسئله این است که فهرست کلمات، معنا را نمی‌فهمد؛ فقط حروف را می‌بیند.

آنتروپیک در کوک‌بوک رسمی‌اش الگویی برای همین مسئله دارد: به‌جای فهرست کلمه، قانون بنویس و قضاوت را به مدل بسپار. در این درس همان الگو را از پایه می‌سازیم، بعد سه لایه رویش سوار می‌کنیم که فرق یک نمونهٔ آزمایشی با یک فیلتر قابل‌اتکا را می‌سازند: زنجیرهٔ فکر، مثال‌های کم‌شمار، و انتخاب آگاهانهٔ مدل برای هزینه و تأخیر.

آنچه در این درس یاد می‌گیرید

  • چرا قانون‌نویسی به زبان طبیعی، جای فهرست کلمات ممنوعه را می‌گیرد
  • قالب پایهٔ پرامپت نظارت و نقش دو دستهٔ BLOCK و ALLOW
  • کد آمادهٔ اجرا برای طبقه‌بندی یک نظر با یک فراخوانی
  • افزودن زنجیرهٔ فکر برای پرونده‌های مرزی و دیدن دلیل تصمیم
  • مثال‌های کم‌شمار؛ چطور چهار نمونه، خطای موارد لبه را کم می‌کند
  • چرا برای این کار مدل کوچک انتخاب می‌شود و سقف توکن خروجی چقدر باشد
فیلتر نظارت محتوا با کلود؛ از قانون‌نویسی تا تصمیم ALLOW یا BLOCK

مسئله را درست صورت‌بندی کنیم

نظارت محتوا در ذاتش یک کار طبقه‌بندی است: ورودی یک متن کاربر است و خروجی یک برچسب. اما با بقیهٔ کارهای طبقه‌بندی یک فرق مهم دارد؛ مرزها را قانون تعیین می‌کند، نه آمار. جملهٔ «بازیگر اصلی ترکاند» و جملهٔ «می‌آیم سراغ خودت و خانواده‌ات» هر دو خشونت لفظی دارند، ولی فقط یکی تهدید است. تفاوتشان در کلمات نیست، در نیت است؛ و نیت را باید از متن فهمید.

الگوی آنتروپیک این تفاوت را با یک ساختار ساده حل می‌کند: در پرامپت، دو دسته تعریف می‌کنی — چه چیزی باید بسته شود و چه چیزی مجاز است — بعد متن کاربر را داخل یک برچسب مشخص می‌گذاری و از مدل می‌خواهی فقط یک کلمه برگرداند. قالب پایه دقیقاً این است:

You are a content moderation expert tasked with categorizing user-generated text based on the following guidelines:

BLOCK CATEGORY:
- [Description or examples of content that should be blocked]

ALLOW CATEGORY:
- [Description or examples of content that is allowed]

Here is the user-generated text to categorize:

<user_text>{{USER_TEXT}}</user_text>

Based on the guidelines above, classify this text as either ALLOW or BLOCK. Return nothing else.

سه نکتهٔ طراحی در همین قالب کوتاه پنهان است. اول، متن کاربر داخل برچسب <user_text> محصور شده تا مدل بفهمد کجا دستور تمام می‌شود و کجا دادهٔ نامطمئن شروع می‌شود — همان چیزی که در درس پاک‌سازی ورودی و مرزبندی محتوای بیرونی مفصل خواندیم. دوم، جملهٔ «Return nothing else» خروجی را به یک کلمه می‌بندد تا لازم نباشد جواب را با عبارات منظم بشکافی. سوم، قانون‌ها فهرست‌وار و کوتاه‌اند؛ چون قرار است بعداً همین‌ها را ویرایش کنی، نه بازنویسی.

پیاده‌سازی؛ کمترین کد ممکن

تابع زیر همان چیزی است که در کوک‌بوک آمده و مستقیم قابل کپی است. قانون‌ها را از تابع بیرون نگه می‌داریم تا سیاست محتوایی سازمان، یک متغیر قابل‌ویرایش باشد نه بخشی از کد:

تا اینجا مقدمه بود. بخش اصلی این درس — نمونه‌ها، پرامپت‌های آماده و تمرین‌ها — برای اعضای ویژه باز می‌شود.

🔒

فیلتر نظارت محتوا با کلود؛ از قانون‌نویسی تا تصمیم ALLOW یا BLOCK

برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.

🎁 ورود / ثبت‌نام و شروع ۱۴ روز رایگان
قبلاً عضو شده‌ای؟ فقط کافی است وارد شوی. اشتراک: از ۱۹۹٬۰۰۰ تومان / ماه
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *