Digisky

سامانه‌های هوش مصنوعی عامل‌محور

عامل‌هایی که برخورد با دادهٔ واقعی را تاب می‌آورند — محدود، راستی‌آزمایی‌شده در برابر پایگاه‌دادهٔ خودتان، و هزینه‌سنجی‌شده پیش از نوشتن اولین خط.

مسئله حساب و کتاب است، نه هوش

عاملی که در اتاق جلسه به پنج پرسش پاسخ می‌دهد ساختنش سخت نیست. شکستی که اهمیت دارد بعداً پیدا می‌شود و شکست استدلال هم نیست: گامی که ۹۹٫۳٪ مواقع موفق است — و این تقریباً بهترین عددی است که کسی مستقلاً اندازه گرفته — وقتی شصت‌وچهار بار پشت هم بیاید، حدود ۶۴٪ مواقع به مقصد می‌رسد. همان مدل در شانزده گام، حدود ۸۹٪.

هیچ‌چیز در آن سامانه خراب نیست. یک عدد خوب آن‌قدر در خودش ضرب شده که دیگر خوب نیست.

شکست دوم بی‌صداتر است. حلقه‌های بلند در ذهن ارزان‌اند و در اجرا گران، و هزینهٔ هر وظیفه معمولاً وقتی کشف می‌شود که صورت‌حساب رسیده باشد. شکست سوم از همه بدتر است: عاملی بدون مسیر راستی‌آزمایی، خروجی روان و مطمئن و غیرقابل‌بررسی تولید می‌کند و سازمان راهی ندارد که اجرای درست را از غلط تشخیص دهد.

«اگر اشتباه کرد، از کجا می‌فهمیم؟»

طراحی‌ای که به این پرسش پاسخ ندهد، تعداد گام‌هایش موضوعیت ندارد.

چطور می‌سازیم

حلقه را محدود کن و شکست را خوانا کن. بودجهٔ گام یعنی عامل یا داخل بودجه تمام می‌کند یا می‌گوید نتوانست. عاملی که می‌گوید «نتوانستم این را اثبات کنم» از عاملی که به‌جایش چیزی محتمل تولید می‌کند ارزشمندتر است.

کار قطعی را از مدل بیرون بکش. اتصال جدول‌ها، پیمایش گراف، فیلتر و محاسبه همه پاسخ درست دارند و پایگاه‌داده هر بار درست جوابشان را می‌دهد. وقتی طرح شصت‌وچهار تکراری تطبیق پرونده‌های حقوقی را هزینه‌سنجی کردیم، خط لولهٔ جایگزین بازیابی و گسترش گراف و راستی‌آزمایی را کاملاً بیرون از حلقه برد — یک پرس‌وجوی بازگشتی، به‌جای مدلی که بارها تصمیم بگیرد گراف را چطور بپیماید. کاهش عمق از ۶۴ به ۱۶ حدود ۲۵ واحد درصد قابلیت اطمینان خرید، با کسری از هزینه.

دو ردهٔ خطا را از هم جدا کن. بازیابی هدررفته توکن هزینه دارد. استناد ساختگی، موکل. خطاهای جبران‌پذیر یک ردیف بودجه‌اند. خطاهای مهلک بنا به ساختار به صفر رانده می‌شوند — با بررسی هر شناسه و هر نقل قول در برابر پایگاه‌داده در مسیر خروج — چون راستی‌آزمایی ویژگی سامانه است و قابلیت اطمینان ویژگی مدل.

چه چیزی تحویل می‌گیرید

سند معماری با بودجهٔ گام و هزینهٔ هر وظیفه. تعریف ابزارهایی که آرگومان بی‌معنا را پیش از اجرا رد می‌کنند. لایهٔ راستی‌آزمایی میان مدل و کاربر. مجموعهٔ ارزیابی، ساخته‌شده پیش از هر تنظیمی. و سند مکتوب آنچه تصمیم گرفتیم نسازیم، با اعدادی که آن تصمیم را گرفتند.

کجا انتخاب اشتباهی است

  • اگر خط لولهٔ ثابت پاسخ می‌دهد، خط لولهٔ ثابت را بسازید. بخش بزرگی از نیازهایی که «عامل» نام می‌گیرند، سه فراخوانی تابع با یک صف جلویشان هستند و گفتنِ همین، بخشی از کار است.
  • اگر خروجی در برابر هیچ مرجعی قابل بررسی نیست، عامل متن مطمئن تولید می‌کند و هیچ‌کس نمی‌تواند حسابرسی‌اش کند.
  • اگر دادهٔ زیرین غلط است، عامل سریع‌تر به پاسخ غلط می‌رسد و قانع‌کننده‌تر بیانش می‌کند. اول داده.
  • اگر تصمیم باید مالِ انسان باشد — یک اظهارنامه، یک تشخیص، یک موضع حقوقی — کار عامل جمع‌آوری شواهد است نه نتیجه‌گیری، و رابط کاربری باید همین را آشکار کند.