سود:
- امکان اندازه گیری و گزارش عدم قطعیت با مجموعه، تحلیل حساسیت، اعتبارسنجی متقاطع و تست کور
- امکان جلوگیری از نشت داده ها با جداسازی آنها بر اساس چاه/میدان و اطمینان از اینکه دقت گزارش شده منعکس کننده تعمیم واقعی است.
- امکان کالیبره کردن امتیاز اعتماد هوش مصنوعی با نمودار قابلیت اطمینان و اعمال نظم عدم استفاده از امتیاز کالیبره نشده به عنوان احتمال
یک موضوع تکرارشونده در هر واحد از این ماژول وجود دارد: هیچ "پاسخ مطمئنی" در ژئوفیزیک وجود ندارد، فقط مدل هایی با عدم قطعیت محدود شده اند. این واحد آن موضوع را به یک رشته تبدیل می کند. عدم قطعیت مدل وجود مدلهای زیرسطحی مختلف است که میتوانند دادههای یکسانی را توضیح دهند و هر مدل دارای یک فاصله اطمینان است. اعتبارسنجی آزمایش با شواهد مستقل است که آیا یک مدل یا خروجی هوش مصنوعی واقعا معتبر است یا خیر. کالیبراسیون این است که اطمینان حاصل شود که مقادیر اطمینان / احتمال داده شده توسط یک مدل با نتایج واقعی مطابقت دارند. در این بخش، ما بررسی خواهیم کرد که چگونه هوش مصنوعی (AI) میتواند عدم قطعیت را اندازهگیری و پنهان کند. و خواهیم دید که چرا یک چارچوب راستیآزمایی و کالیبراسیون، هوش مصنوعی را قابل اعتماد میکند.
منابع عدم قطعیت
عدم قطعیت ژئوفیزیک از چندین لایه ناشی می شود:
- عدم قطعیت داده: نویز اندازه گیری، پوشش محدود، خطای کالیبراسیون.
- عدم قطعیت مدل (چند معنایی): برازش بیش از یک ساختار زیرسطحی با داده های مشابه.
- عدم قطعیت روش/پارامتر: انتخابهای پردازش، وارونگی و منظمسازی نتیجه را تغییر میدهند.
- عدم قطعیت ویژه هوش مصنوعی: توانایی مدل برای حفظ اعتماد به نفس اما شکست زمانی که خارج از توزیع آموزشی حرکت می کند (تغییر توزیع).
کار یک ژئوفیزیکدان خوب حذف این عدم قطعیت نیست، بلکه اندازه گیری، ارتباط و محدود کردن آن است. هوش مصنوعی می تواند این کار را آسان کند (تولید چند سناریو) اما همچنین می تواند به راحتی آن را با تولید یک پاسخ مطمئن پنهان کند.
راه های اندازه گیری عدم قطعیت
چند ابزار کاربردی:
- Ensemble: اجراهای متعدد با شروع، پارامترها یا مدل های مختلف. گسترش نتایج باعث عدم اطمینان می شود.
- تجزیه و تحلیل حساسیت: تغییر یک ورودی (پارامتر، زیر مجموعه داده ها) و مشاهده میزان تغییر نتیجه.
- اعتبار سنجی متقابل: تقسیم داده ها به قطعات، آموزش با یک قسمت و آزمایش با قسمت دیگر. قدرت تعمیم را اندازه گیری می کند.
- تست کور: تست مدل با چاه/میدان مستقلی که هرگز در تمرین ندیده است.
- خروجی احتمالی: ارائه نتیجه به عنوان فاصله توزیع/اطمینان، نه یک مقدار واحد.
نکته: وقتی هوش مصنوعی نتیجه ای می دهد، همیشه بپرسید: "برای تغییر این نتیجه چه چیزی و چقدر باید در ورودی جابجا شود؟" اگر نتیجه با یک تغییر کوچک پارامتر معکوس شود، آن نتیجه شکننده است و عدم قطعیت زیاد است.
کالیبراسیون: آیا امتیاز اطمینان درست است؟
مدلهای هوش مصنوعی اغلب یک اطمینان/احتمال ("90% خطا") میدهند. اما این عدد اگر کالیبره نشده باشد گمراه کننده است: این مدل در واقع در 60٪ مواردی که می گوید "90٪" است، درست است. کالیبراسیون به این صورت است که این عدد را با نرخ نتیجه واقعی تراز کنید. در عمل، نمودار قابلیت اطمینان ترسیم می شود: یک مدل خوب کالیبره شده واقعاً 90٪ درست است که می گوید "90٪". در ژئوفیزیک، کالیبره کردن امتیاز اطمینان هوش مصنوعی با داده های مستقل قبل از اینکه مبنای تصمیم گیری باشد، ضروری است.
احتیاط: دقت بالا با کالیبراسیون خوب یکسان نیست. یک مدل ممکن است به طور کلی دقیق اما بیش از حد اعتماد به نفس باشد. نکته مهم در تصمیم گیری های حیاتی این است که وقتی می گوید "95٪" واقعا قابل اعتماد است. امتیاز اطمینان کالیبره نشده را به عنوان یک احتمال تلقی نکنید.
قوانین طلایی تایید
برای راستیآزمایی قوی: (1) استقلال - دادههای تست به هیچ وجه نباید با فرآیند آموزش/تنظیم تداخل داشته باشند (نشت دادهها - نتیجه را افزایش میدهد). (2) تست کور - میدان/چاهی که مدل نمی بیند. (3) سازگاری فیزیکی - نتیجه نباید با فیزیک و زمین شناسی مغایرت داشته باشد. (4) تکرارپذیری - همان نتیجه با ورودی یکسان، و می تواند توسط شخص دیگری تولید شود. (5) مستندات - ضبط از چه داده ها، کدام پارامتر، کدام نسخه مدل استفاده شده است.
سه کیف کوچک
مورد 1 - اشتباه در نشت داده ها. یک تیم گزارش داد که طبقهبندیکننده رخساره 94 درصد دقت دارد. بررسی نشان داد که نمونههای همسایه از یک چاه هم در آموزش و هم در آزمایش (نشت داده) شرکت داشتند. وقتی به خوبی تقسیم شد، دقت به 71% کاهش یافت - این تعمیم واقعی بود. این نشت باعث شد که مدل بهتر از آنچه بود به نظر برسد.
مورد 2 - مدل بیش از حد اعتماد به نفس. یک ردیاب عیب "95% اطمینان" را به علائم خود داد. نمودار قابلیت اطمینان نشان داد که علائم "95٪" در واقع 70٪ دقیق هستند. هنگامی که مدل کالیبره شد، نمرات اطمینان واقعی شد و مفسران به درستی تنظیم کردند که چقدر به هر علامت اعتماد دارند.
مورد 3 - وارونگی شکننده. یک مدل جاذبه بسیار قانع کننده به نظر می رسید. تجزیه و تحلیل حساسیت نشان داد که ساختار اصلی زمانی که وزن تنظیم 20٪ تغییر کرد ناپدید شد: ساختار از داده ها به دست نیامد، بلکه از انتخاب پارامتر حاصل شد. تیم ساختار را به عنوان "اعتماد پایین" علامت گذاری کرد و داده های اضافی را درخواست کرد.
چهار قالب قابل کپی
1) طرح اندازه گیری عدم قطعیت:
نقش شما: مشاور عدم قطعیت ژئوفیزیک. من یک نتیجه [ وارونگی / طبقه بندی / پیش بینی] دارم. برای اندازه گیری عدم قطعیت از کدام روش ها (انسامبل، حساسیت، اعتبارسنجی متقابل، کورکورانه) و به چه ترتیبی استفاده کنم؟ توضیح دهید که هر کدام به من چه می گوید و چگونه نتیجه را گزارش کنم.
2) بررسی کالیبراسیون:
مدل هوش مصنوعی من یک امتیاز اطمینان/احتمال می دهد. چگونه می توانم تست کنم که آیا این نمره کالیبره شده است؟ چگونه می توانم یک نمودار قابلیت اطمینان ایجاد کنم، "اعتماد بیش از حد" یا "احتیاط بیش از حد" را تشخیص دهم و امتیاز را با نرخ نتیجه واقعی تراز کنم؟
3) ممیزی نشت داده ها:
من یک طبقه بندی کننده ژئوفیزیک را آموزش دادم. چگونه می توانم خطر نشت داده ها را پیدا کنم و از آن جلوگیری کنم (همان چاه/نمونه های میدانی هم وارد آموزش و هم تست می شوند)؟ چگونه جداسازی را بر اساس چاه/میدان تنظیم کنم؟ چگونه بفهمم که دقت گزارش شده منعکس کننده تعمیم واقعی است؟
4) آزمایش شکنندگی نتیجه:
من یک نتیجه وارونگی/مدل دارم. من می خواهم بفهمم این نتیجه چقدر شکننده است. با تغییر کدام پارامترها و چقدر ساختار اصلی تغییر می کند؟ چگونه می توانم تشخیص دهم که ساختار از داده ها می آید یا پارامترها / مقدمه؟ یک پروتکل حساسیت بدهید.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
ببینید آیا مدل من دقت بالایی دارد یا خیر.
یک عدد حقیقت واحد؛ نشت کالیبراسیون و تعمیم را پنهان می کند و اعتماد به نفس کاذب می دهد.
اعلان قدرتمند:
نقش شما: کارشناس اعتبارسنجی مدل. ورودی: [طبقهبندیکننده N خوب، امتیازات اطمینان تولید میکند]. وظیفه: (1) پیشنهاد تخصیص مبتنی بر خوب در برابر نشت داده. (2) تست چاه کور را نصب کنید. (3) نمره اطمینان را با نمودار قابلیت اطمینان کالیبره کنید. (4) تست کنید که نتیجه چقدر به پارامتر حساس است. کاهش به یک عدد صدق واحد؛ تعمیم، کالیبراسیون و شکنندگی را جداگانه گزارش دهید.
درخواست نشتی، آزمایش کور، کالیبراسیون و حساسیت، تأیید را صادقانه می کند.
ابزار عدم قطعیت
وسیله نقلیه
چه چیزی را اندازه گیری می کند؟
ریسک اصلی
خروجی
گروه
انتشار مدل
هزینه حساب
محدوده / توزیع
حساسیت
اثر پارامتر
ورودی از دست رفته
شکنندگی
اعتبار سنجی متقابل
تعمیم
نشت داده ها
دقت واقع بینانه
تست کور
موفقیت مستقل
مجموعه تست ناکافی
اعتماد
کالیبراسیون
به واقعیت اعتماد کن
اعتماد به نفس بیش از حد
احتمال هم تراز
اشتباهات رایج
- عدم توجه به نشت اطلاعات عدالت را باد می کند; جدا کردن بر اساس چاه / مزرعه.
- استفاده از امتیاز اطمینان بدون کالیبره کردن آن. "90٪" ممکن است در واقع 90٪ نباشد.
- تکیه بر عدد حقیقت واحد. تعمیم و کالیبراسیون دو چیز متفاوت هستند.
- آسیب پذیری را آزمایش نمی کند. ساختار از دست رفته توسط پارامتر اطلاعات واقعی نیست.
- عدم گزارش عدم قطعیت ارائه نتیجه بدون فاصله اطمینان گمراه کننده است.
به طور خلاصه
عدم قطعیت واقعیت ریشه کن نشدنی ژئوفیزیک است. کار این است که آن را اندازه گیری کنید، با آن ارتباط برقرار کنید، و آن را محدود کنید. هوش مصنوعی این کار را با مجموعه، حساسیت و خروجی احتمالی تسهیل می کند، اما همچنین می تواند آن را با یک پاسخ مطمئن پنهان کند. یک قاب جامد؛ جلوگیری از نشت داده ها، اندازه گیری تعمیم با آزمایش کور، کالیبره کردن امتیاز اطمینان، و آزمایش شکنندگی نتیجه. اعتماد کالیبره نشده، صداقت تایید نشده و عدم اطمینان پنهان، سه توهم خطرناک هستند. ژئوفیزیک قابل اعتماد ژئوفیزیکی است که صادقانه عدم قطعیت خود را نشان می دهد.
وظیفه کاربردی
یک نتیجه ژئوفیزیک هوش مصنوعی (طبقه بندی، وارونگی یا پیش بینی) را انتخاب کنید. مراحل تست گروهی/حساسیت/کور را با الگوی "طرح اندازه گیری عدم قطعیت" برنامه ریزی کنید. سپس تمایز آزمون قطار خود را با الگوی «ممیزی نشت داده» آزمایش کنید. اگر مدل نمره اطمینان می دهد، با الگوی "بررسی کالیبراسیون" ارزیابی کنید که آیا امتیاز واقعی است یا خیر و نتیجه خود را با فاصله اطمینان بنویسید.
چک لیست
- [ ] من عدم قطعیت را با گروه/حساسیت اندازه گرفتم.
- [ ] من از نشت داده ها با جداسازی آن بر اساس چاه/میدان جلوگیری کردم.
- [ ] تعمیم را با آزمون کور آزمایش کردم.
- [ ] من نمره اطمینان را کالیبره کردم و واقعی بودن آن را بررسی کردم.
- [ ] من نتیجه را با فاصله اطمینان گزارش کردم، نه یک مقدار واحد.