единица 11 / 11

Интеграция от край до край, MLOps и отговорност на инженера

Печалби:

  • Възможност за проектиране на поддържан от AI автомобилен проект от концепция до производство и поддържането му с цикъл на наблюдение
  • Възможност за оценка на управлението на версията на модела, дрейфа на данните и нуждите от преквалификация
  • Възможност за безопасно мащабиране на AI, като същевременно се поддържа отчетност, проследимост и документация в целия проект

В последната единица на този модул събираме всички части заедно. Видяхме как изкуственият интелект се използва в отделни единици, от дизайна до производството, от тестването до веригата за доставки. Но в един реален проект това не са изолирани стъпки, а жизнен цикъл: данните се събират, моделът се изгражда, пуска се в производство, наблюдава се и когато остарее, се обновява. Дисциплината за поддържане на този цикъл се нарича MLOps (Machine Learning Operations). Този модул обхваща настройката, поддръжката и поддържането на отчетност за автомобилен проект, задвижван от AI, от край до край.

Жизнен цикъл на AI проект

Типичен поток от край до край в автомобилен контекст:

  1. Дефиниране на проблем и стойност: Какъв бизнес проблем решаваме? Как се измерва успехът? Това критична за сигурността функция ли е?
  2. Събиране на данни и етикетиране: Източници (CAN, тестване, производство, телематика), качество, поверителност.
  3. Разработване на модел: Атрибут, модел, проверка (контрол на течове, консистенция на единица).
  4. Проверка и оценка на сигурността: Независимо тестване, ако се изисква ISO 26262/SOTIF.
  5. Внедряване: Внедряване на модела в устройството, онлайн или в облака.
  6. Мониторинг: производителност, отклонение на данните, точност на алармата.
  7. Преквалификация: Актуализиране на модела, когато остарее.
  8. Документиране и проследимост: Запис на всяка стъпка; кой, кога, защо.

Този цикъл не свършва веднъж завинаги; се върти постоянно. В автомобилостроенето е опасно да "настроиш и забравиш" модел.

Съвет: Когато стартирате проекта, "кой ще наблюдава този модел, след като е в полето, с какъв показател и колко често?" Ако не можете да отговорите на въпроса, моделът все още не е готов за производство.

Управление на версията на модела и проследимост

Проследимостта в автомобилостроенето не е лукс, а често законово задължение. Когато възникне проблем, трябва да можете да отговорите на въпроса "каква версия на модела, с какви данни е обучен, кой го е одобрил?" Добри практики:

  • Версии на модела: Номерът на всеки модел, данните за обучението и датата се записват.
  • Версии на данни: Данните, върху които е обучен, са замразени.
  • Дневник на решенията: Одобрението е дадено от кого и с какви доказателства.
  • План за връщане назад: Ако новият модел се окаже лош, можете да се върнете към стария.

елемент

Защо е необходимо

Риск, ако липсва

Моделна версия

Коя версия е в полето?

Проблемът не може да бъде проследен

Версия на данни

С какво е бил обучаван?

не се възпроизвежда

Запис за одобрение

Кой е отговорен?

не може да се търси отговорност

отмяна

Връщане от лоша версия

Дълъг престой на полето

Дрейф на данни и затихване на модела

Моделът е моментна снимка на света, в който е обучен. Но светът се променя: нов доставчик на части носи различна толерантност на сензора, излиза нов модел превозно средство, сезоните се променят, навиците на шофиране се променят. Производителността на модела тихо намалява, когато разпределението на входните данни се отдалечава от времето за обучение. Това отклонение на данните и произтичащото от това намаляване на производителността се нарича затихване на модела.

Опасността е, че този спад е тих: моделът не се срива, не прави грешки, той просто става все по-грешен. Следователно:

  • Наблюдавайте входното разпределение (откриване на отклонение).
  • Наблюдавайте показателите за ефективност с реални резултати (точни ли са алармите?).
  • Задействайте повторно обучение, когато прагът бъде надвишен.
Внимание: предположението, че „веднъж обучен моделът, той дава същата производителност завинаги“ е погрешно и рисковано в автомобилостроенето. Модел, пуснат в производство без мониторинг на дрейфа, може несъзнателно да стане ненадежден.

Примерен сценарий от край до край: флот за предсказуема поддръжка

Нека го направим бетон. Вие инсталирате система за ранно предупреждение за повреда на турбо за товарен флот:

  1. Стойност: Намалете времето за престой и разходите за теглене; успех = уловен баланс на действителна грешка/фалшива аларма.
  2. Данни: CAN сигнали на 40 превозни средства, исторически записи на грешки; VIN е анонимизиран.
  3. Модел: Anomaly + RUL; предотвратено изтичане на времеви редове; Представен е диапазонът на несигурност.
  4. Проверка: Тестване за минали грешки; Цената на фалшивата тревога беше претеглена.
  5. Продукция: Ежедневен резултат в облака; панел към техник.
  6. Мониторинг: Контрол на дрифта при добавяне на нов модел превозно средство; точност на алармата седмично.
  7. Преквалификация: Тримесечна актуализация с нов тип превозно средство и нови примери за грешки.
  8. Документация: Версия на модела, версия на данните, регистриран сертифициращ инженер.

Нито една стъпка в този поток не казва „AI взе решение, готово“; За всеки етап отговаря човек.

Мини казуси

Случай 1 - Тих разпад. Моделът за контрол на качеството работи добре за една година, след което степента на изтичане бавно се увеличава. Основна причина: Когато доставчикът се промени, текстурата на повърхността на частта стана малко по-различна (отклоняване) и моделът започна да мисли, че това е „нормално“. Установен е мониторинг на дрейфа и моделът е преквалифициран. Резултат: Без наблюдение уязвимостта щеше да остане незабелязана с месеци.

Случай 2 - Проследимостта е запазена. Оплакване за фалшива тревога идва от полето. От дневника на решенията екипът открива коя версия на модела работи с какви данни; Той открива, че проблемът идва от настройката на прага в определена версия и връща тази версия назад. Резултат: Ако няма запис на версия и решение, проблемът не може да бъде проследен.

Казус 3 - Преквалификация на дисциплината. Когато нов електрически модел се присъедини към автопарка, съществуващият модел за предсказуема поддръжка предизвиква много фалшиви аларми за това превозно средство (задвижване, което никога не е виждало). Преди да пусне в експлоатация новия модел, екипът заснема предупреждението за дрейф и разширява модела с нови данни за превозното средство. Резултат: Наблюдението на дрейфа рано улови влошаването, което дойде с новия продукт.

подканващи шаблони

Шаблон 1 - Проект на план на проекта:

Роля: Ръководител на AI проект (автомобилен). Задача: Помогнете ми да планирам проект, задвижван от AI от край до край. Контекст: Предсказуема поддръжка; Автопарк от 40 автомобила; VIN е анонимен. Ограничение: Обмислете отделно стъпките за дефиниране на стойността, данни, модел, проверка, производство, мониторинг, преквалификация и документация; посочете кой е отговорен за всяка стъпка. Резултат: Стъпка | изход | отговорен | таблица на риска.

Образец 2 – План за наблюдение:

Роля: Вие сте MLOps инженер. Задача: Препоръчайте план за мониторинг за модел, който се въвежда. Контекст: Разпределението на входа може да се промени с течение на времето (нов доставчик, нов инструмент); производителността може да бъде измерена чрез реални резултати. Изход: Метрика за проследяване | праг | действие, което да бъде задействано.

Шаблон 3 - Оценка на дрифта:

Роля: Учен по данни. Задача: Обяснете как да откриете отклонение на данните и кога е необходимо преквалификация. Контекст: Модел за визуална проверка на производствената линия; Възможна е смяна на доставчика. Изход: Сигнал | измерване | тригер за преквалификация.

Шаблон 4 – Контролен списък за проследяване:

Роля: Вие сте одитор по качество/съответствие. Задача: Създайте контролен списък за проследимост за модел. Контекст: Автомобили; Когато възникне проблем, трябва да се отговори на въпроса „коя версия, кои данни, кой го е одобрил“. Резултат: Елемент | защо е необходимо | как да запазите графика.

Слаба подкана / Силна подкана

Слаба подкана:

Поставете модела в производство.

Без проследяване, без версии, без отчетност и без връщане назад; Тихият разпад и непроследимите проблеми са неизбежни.

Мощна подкана:

Роля: Вие сте MLOps и консултант по качеството на автомобилите. Задача: Създайте контролния списък, от който се нуждая, за да пусна отговорно модел в производство. Контекст: Автопарк за прогнозна поддръжка; С течение на времето се добавят нови типове превозни средства; VIN anonymous. Ограничение: Включете мониторинг, откриване на дрейф, версия/регистриране на данни, потвърждение и план за връщане назад; Посочете кой е отговорен за всеки елемент; предложение „задайте и забравете“. Резултат: Етап | необходимост | отговорен | таблица на риска.

Често срещани грешки

  • Подход „Настрой и забрави“. Без наблюдение моделът тихо се разпада.
  • Не се поддържат записи на версия/данни. Проблемът не може да бъде проследен или възпроизведен.
  • Няма план за връщане назад. Ако възстановяването от лошо издание отнеме много време, ще има дълъг отказ в полето.
  • Не чака Drift. Нов доставчик/инструмент/сезон нарушава модела; наблюдението е от съществено значение.
  • Оставяне на отговорността неясна. Отговорът „кой е отговорен” трябва да е ясен на всяка крачка.

В обобщение

  • Захранван от AI автомобилен проект не е еднократен, а непрекъснат жизнен цикъл (MLOps).
  • Версиите на модели и данни, регистрирането на решения и планирането на връщане са от съществено значение за проследимостта.
  • Дрейфът на данните мълчаливо опровергава модела; входът и представянето трябва да бъдат наблюдавани и преквалифицирани, ако е необходимо.
  • В примера от край до край всяка стъпка има отговорен човек; Няма "ИИ реши, край".
  • „Настрой и забрави“ е рисковано в автомобилостроенето; мониторингът, документирането и отчетността се поддържат по време на целия проект.

Задача за приложение

Комбинирайте наученото в този модул в един проект (напр. визуална проверка на производствена линия или предсказуема поддръжка). (1) Изготвяне на план за проект от край до край с Шаблон 1; Запишете лицето, отговорно за всяка стъпка. (2) Дефинирайте план за мониторинг и тригери за дрейф с Шаблон 2. (3) Подгответе контролен списък за проследимост с Шаблон 4. (4) Обобщете в параграф как сте приложили трите основни дисциплини от началото на модула към този проект.

контролен списък

  • [ ] Планирах проекта като жизнен цикъл от край до край.
  • [ ] Дефинирах записа на решение с версия на модел и данни.
  • [ ] Зададох план за наблюдение и задействания за дрейф.
  • [ ] Подготвих план за връщане назад.
  • [ ] Изясних кой е отговорен за всяка стъпка.
  • [ ] Поддържах трите дисциплини за валидиране на котва и валидирането, критично за човешката сигурност.

Изпит по модул

1. Каква е ролята на изхода на AI в решение, което е критично за безопасността на автомобила (напр. проверка на спирачния софтуер)?

  • A) Ускорява анализа, но окончателното одобрение и отговорността остават за компетентния инженер ✔
  • B) Ако има достатъчно данни, може да се пусне в производство без одобрение от инженер
  • C) AI не може да се използва на нито един етап в критични системи като спирачки
  • D) Ако точността на модела надвишава 99%, човешката проверка не е необходима

Описание: Изкуственият интелект ускорява анализа, генерира кандидат-решения и резюмета; Критичното за безопасността решение и окончателното одобрение обаче са отговорност на компетентния инженер. AI не е заместител на инженерното валидиране.

2. Кои са трите независими проверки, използвани за тестване на резултата от AI в трите дисциплини за валидиране на котва?

  • A) Дължина, език и формат на подканата
  • B) Доказателство за порядък на величина, инженерна разумност и независимо изпитване/измерване ✔
  • C) Размер на модела, време за обучение и брой графични процесори
  • Г) Марка на доставчика, цена и време за доставка

Описание: Три котви; порядък на величина (проверка на поръчката), инженерна правдоподобност (физика/опит) и кръстосано валидиране с независими доказателства от тестове/измервания. Тези три осигуряват доверие в доказателствата, а не доверие в AI.

3. Коя е най-критичната проверка за изхода на „сурогатен модел“, който ускорява CFD или FEA симулация?

  • А) Сурогатният модел винаги е по-точен от истинския решаващ проблем
  • B) Достатъчно е просто рендерът да изглежда естетически приятен
  • C) Сравнение с референтното решение и приемане на ненадеждност при движение извън пространството за обучение ✔
  • Г) Няма нужда да се разглежда независимостта на мрежата, ако един цикъл се сближава

Описание: Сурогатният модел произвежда бързи прогнози вместо истинския решаващ инструмент; но е ненадежден извън дизайнерското пространство, в което е бил обучен. Резултатът трябва да бъде проверен чрез маркиране на областта на екстраполация с референтна симулация с висока точност и физически гранични условия.

4. Какъв е правилният израз за Ниво 2 (частична автоматизация) в нивата на автоматизация SAE?

  • A) Превозното средство може да се движи без шофьор при всякакви условия
  • B) Системата не поема никакви задължения за шофиране, а само дава предупреждения
  • В) Добре е, ако той не седи на шофьорското място
  • D) Системата поддържа управление и скорост, но водачът запазва постоянен надзор и отговорност ✔

Описание: В ниво 2 системата поддържа управление и скорост/дистанция едновременно, но водачът запазва постоянно наблюдение и е готов да поеме управлението по всяко време; Отговорността е на водача. На ниво 3 и по-високо системата поема задълженията по шофиране при определени условия.

5. Защо „коефициентът на бягство“ е критичен показател при визуално откриване на дефекти на производствената линия?

  • A) Одобряването на дефектната част и изпращането й на полето представлява риск за безопасността и изземването ✔
  • Б) Важно е само защото забавя скоростта на линията
  • C) Степента на изтичане е валидна само за дефекти на боята
  • D) Степента на теч измерва времето за обучение на модела

Описание: Незаконен; Дефектната част се счита за перфектна и преминава през линията (фалшиво отрицателно). За автомобилна защитна част изтичането е много по-скъпо от фалшивото отхвърляне, тъй като може да доведе до повреда или изземване на място; Прагът се коригира съответно.

6. Каква е най-точната употреба на оценката на „оставащия полезен живот“ (RUL) при прогнозна поддръжка?

  • A) RUL се изчислява само за двигателно масло
  • B) Трябва да се представи с диапазон на несигурност и да се тълкува според прозореца за поддръжка и границата на безопасност ✔
  • В) Трябва да се приема като стойност за един точен ден и не трябва да се правят проверки до този ден.
  • D) Сензорите могат да бъдат изключени, ако RUL е високо

Описание: RUL е очакваното оставащо време на работа на компонент до повреда; Той трябва да бъде представен с диапазона на несигурност и да се тълкува в съответствие с плана за поддръжка и запаса на безопасност. Вместо сляпо да се разчита на оценка от една точка, доверителният интервал и цената на фалшивата аларма се вземат предвид.

7. Какво трябва да направи инженерът, когато AI маркира аномалия в запис на пътен тест при анализ на тестови данни?

  • A) Когато видите аномалията, тестът трябва автоматично да се счита за неуспешен.
  • B) AI изобщо не трябва да разглежда данните, ако не ги е маркирал
  • C) Проверете аномалията със сурови данни, несигурност на измерването и повторяемост ✔
  • D) Изтриване на аномалии и изчистване на отчета

Обяснение: Аномалията, която AI маркира, е улика, а не заключение. Инженерът трябва да провери несигурността на измерването, възможността за повреда на сензора и повторяемостта и да провери аномалията с необработени данни и критерии за приемане. Автоматичното приемане или отхвърляне не е подходящо.

8. Каква проверка е задължителна за съществена промяна, предложена от AI в олекотено проучване?

  • А) Просто трябва да е по-лек
  • B) Един единствен ред в базата данни с материали може да се приеме като доказателство
  • C) Поведението при сблъсък е маловажно при леки материали
  • D) Изискванията за механика, умора, сблъсък, технологичност и разходи трябва да бъдат тествани заедно ✔

Забележка: Препоръката за материал не може да бъде приета въз основа единствено на съотношението плътност/якост; механичните свойства, умората, поведението при сблъсък, технологичността, корозията, разходите и изискванията за безопасност трябва да бъдат проверени заедно и потвърдени чрез физическо изпитване.

9. Защо „рискът от един източник“ във веригата за доставки на автомобили изисква специално внимание в препоръките за ИИ?

  • A) Прекъсване на един доставчик може да спре цялото производство; Вторият източник и буферът трябва да бъдат оценени ✔
  • B) Един източник винаги е най-безопасният вариант
  • В) Анализът на риска не е необходим, ако се предложи AI
  • D) Рискът от един източник се отнася само за гумата

Обяснение: Ако дадена част идва от един доставчик, производството спира, когато има проблем с този доставчик. AI може да препоръча един източник на оптимизиране на разходите; Инженерът/планировчикът трябва да балансира това с вторичен ресурс, запасен буфер и анализ на сценария. Цената не е единственият критерий.

10. Какво означава „изтичане на данни“ при извършване на телеметричен анализ с Python и защо е опасно?

  • A) Данните са изтекли от диска и са изтрити
  • B) Моделът вижда в обучението информация, която не може да бъде известна към момента на прогнозиране; Надува резултата, срива се на терена ✔
  • В) Смесване на графични цветове
  • D) Среща се само в данни за изображения

Описание: Изтичане на данни; Това е, когато моделът вижда в обучението информация, която всъщност не може да бъде известна по време на прогнозиране (например бъдеща стойност или атрибут, свързан с целта). Това изкуствено повишава резултата от теста, но срива представянето на полето. Разграничението минало/бъдеще трябва да се поддържа щателно във времевия ред.

11. Какво определя класификацията ASIL в контекста на функционалната безопасност на ISO 26262?

  • А) Максимална скорост на автомобила
  • B) Размер на обучителния набор от данни на модела
  • C) ✔ Необходимото ниво на безопасност според тежестта, експозицията и контролируемостта на опасността.
  • Г) Кредитен рейтинг на доставчика

Описание: ASIL (Ниво на интегритет на автомобилната безопасност) определя нивото на предпазни мерки за безопасност (от A до D, D е най-високото), които дадена опасност изисква въз основа на нейната оценка на тежестта, експозицията и контролируемостта. Високият ASIL изисква по-стриктно разработване, проверка и документиране.

12. По какъв начин ISO 21448 (SOTIF) се различава от класическата функционална безопасност (ISO 26262)?

  • A) Обработва само хардуерни повреди
  • B) Регулира само лицензирането на софтуер
  • C) SOTIF е старото име на ISO 26262
  • D) Адресира рискове, произтичащи от неадекватна функционалност и неразпознати сценарии, дори при липса на повреда ✔

Описание: Докато ISO 26262 адресира рискове, произтичащи от неизправности/хардуерно-софтуерни грешки, SOTIF (Безопасност на предвидената функционалност) адресира рискове, произтичащи от неадекватно откриване, неразпознати сценарии и функционални ограничения, дори ако системата изобщо не работи неизправно; е особено критичен при откриване, базирано на AI.

13. Какъв е най-добрият подход по отношение на поверителността при работа с телеметрични данни за водача и превозното средство?

  • A) Съответствие с KVKK/GDPR с анонимизиране, минимизиране на данните и ограничаване на целта ✔
  • B) Изпращане на всички необработени данни към публичен модел заедно с VIN
  • C) Поверителността се отнася само за маркетинговите данни
  • Г) Данните за местоположение никога не се считат за лични данни

Описание: Данни като местоположение, поведение при шофиране и номер на шаси (VIN) могат да идентифицират човек. Най-правилният подход; анонимизиране/псевдонимизиране на данни, събиране само на необходимото (минимизиране на данните), ограничаване на целта и съответствие с KVKK/GDPR. Изпращането на необработен VIN или местоположение до инструменти на трети страни е рисковано.

14. Защо е необходимо да се наблюдава „отклоняването на данните“ в модел на AI, пуснат в производство?

  • A) След като моделът бъде обучен, той дава същата производителност за неопределено време.
  • B) Производителността тихо намалява, тъй като разпределението на входа се променя с времето; трябва да се задейства преквалификация ✔
  • C) Дрейфът е просто физическа вибрация на хардуера
  • Г) Мониторингът не е необходим, тъй като моделът се актуализира автоматично

Обяснение: Реалният свят се променя (нов доставчик на части, сезон, нов модел превозно средство); Производителността на модела тихо намалява, когато входното разпределение се отдалечава от времето за обучение. Преобучението се задейства от мониторинг на дрифта и показатели за ефективност. Подходът „настрой и забрави“ е рискован в автомобилостроенето.