Czym tak naprawdę jest sztuczna inteligencja, gdy minie efekt zachwytu z demonstracji?
To pierwsze i najwartościowsze pytanie w każdym bootcampie AI. Odpowiedź jest prostsza, niż większość osób się spodziewa. Systemy AI są budowane na danych, modelu oraz sposobie wykorzystania tego modelu w produkcie lub procesie pracy. Jeśli którykolwiek z tych elementów jest słaby, cały system wydaje się chwiejny.
Uczę od tego punktu wyjścia, ponieważ pomaga to uniknąć typowych nieporozumień. Ludzie często słyszą o czatbotach, autonomicznych samochodach, generatorach obrazów czy robotach fabrycznych, jakby chodziło o jedną rzecz. Nie jest to prawda. To różne systemy oparte na różnych rodzinach modeli i różnych ograniczeniach.
Dobre wprowadzenie inżynierii AI zaczyna się od funkcji systemu, a nie huku wokół niego. Niektóre systemy klasyfikują. Niektóre wykrywają obiekty. Niektóre przewidują wartości. Niektóre generują nowy tekst lub obrazy. Niektóre kontrolują urządzenia fizyczne. Etykieta ma mniejsze znaczenie niż faktyczne zadanie.
Sztuczną inteligencję najlepiej rozumieć jako oprogramowanie, które uczy się wzorców z przykładów. Zwykły program wykonuje reguły zapisane przez człowieka. Model AI uczy się tych reguł z danych, a następnie stosuje je do nowych wejść. Ta zmiana może wydawać się niewielka, ale zmienia sposób budowy całego systemu.
Podstawowe elementy systemu AI
Każdy system AI posiada kilka kluczowych części.
Pierwsza to dane wejściowe. Mogą to być tekst, obrazy, klatki wideo, odczyty z czujników czy rekordy biznesowe. System może uczyć się tylko tego, co widzi, a to, co widzi, kształtuje to, co potrafi robić.
Drugim elementem jest model. To ta część, która uczy się wzorców. W konfiguracji uczenia maszynowego może przewidywać etykietę lub liczbę. W przypadku generatywnej AI może tworzyć nowy tekst lub obrazy. W computer vision (wizji komputerowej) może znajdować obiekty, segmentować skany medyczne lub śledzić ruch na nagraniu wideo.
Trzecia to wdrożenie (deployment). Oznacza to umieszczenie modelu w rzeczywistym systemie. Może działać w aplikacji internetowej, usłudze backendowej, robocie, potoku kamery czy telefonie. Model działający w notatniku Jupyter jeszcze nie jest systemem. To ulubiona pułapka w tej dziedzinie.
Właśnie tutaj inżynieria AI zaczyna nabierać realnego wymiaru. Najtrudniejszą częścią często nie jest trenowanie modelu. To dopasowanie go do niezawodnego procesu pracy. Opóźnienia, zużycie pamięci, przypadki awarii i jakość danych wejściowych mają ogromne znaczenie. Modele nie przejmują się terminami. Produkty tak.
Trzy główne rodzaje pracy z AI
Systemy AI zazwyczaj dzielą się na trzy szerokie grupy.
Tradycyjne uczenie maszynowe wykorzystuje dane historyczne do dokonywania predykcji. Bank może szacować ryzyko. Sklep może prognozować popyt. System logistyczny może przewidywać czas dostawy. Te narzędzia wykonują cenną pracę w miejscach, które nie pojawiają się w efektownych demonstracjach.
Computer vision zajmuje się obrazami i wideo. Model może wykryć twarz, znaleźć guz na skanie lub obserwować linię produkcyjną pod kątem defektów. Wideo jest trudniejsze niż pojedynczy obraz, ponieważ klatki zmieniają się w czasie. Model musi śledzić ruch i kontekst.
Generatywna AI tworzy nową treść. Duże modele językowe (LLM) są najbardziej znanym przykładem. Przewidują kolejne słowo lub token na podstawie tekstu, który już widziały. Daje im to zdolność odpowiadania na pytania, pisania tekstów i wykonywania instrukcji. Generatory obrazów używają podobnej idei, ale dla wyjścia wizualnego.
Nie są to magiczne kategorie. To narzędzia inżynieryjne. Każde z nich jest przydatne w odpowiednim miejscu i niezgrabne w niewłaściwym. Klasyfikator jest słaby w długich tekstach. Model językowy jest słaby w precyzyjnych obliczeniach arytmetycznych, jeśli nie zostanie otoczony dodatkową logiką. Model wizyjny nie jest w stanie wywnioskować, czego brakuje na zdjęciu zrobionym z złego kąta. Rzeczywistość zapewnia płatne rachunki.
Jak computer vision wpisuje się w ten obraz
Computer vision to jeden z najjaśniejszych sposobów zrozumienia inżynierii AI, ponieważ dane wejściowe są namacalne. System widzi piksele, a następnie zamienia je w użyteczne znaczenie. Zdjęcie ulicy dla komputera to wciąż tylko liczby, dopóki model nie znajdzie krawędzi, kształtów, obiektów i relacji.
CNN, czyli sieci konwolucyjne, stały się klasycznym narzędziem do tego zadania. Są dobre w znajdowaniu wzorców w danych obrazowych. Wczesne warstwy uczą się prostych cech, takich jak krawędzie i tekstura. Późniejsze warstwy uczą się większych struktur, takich jak koła, twarze czy oznaczenia pasów ruchu. Ten krok po kroku budowanie wzorców jest powodem, dla którego CNN stały się tak ważne.
Transformery również odgrywają teraz istotną rolę, zwłaszcza w nowoczesnych systemach generatywnych. Dobrze radzą sobie ze związkami w danych i przeniosły się również do zadań wizyjnych. GAN, czyli adversarialne sieci generatywne, są używane do tworzenia realistycznych obrazów syntetycznych. U-Nety są powszechne w segmentacji obrazów medycznych, gdzie model musi ostrożnie oznaczać każdy piksel. EfficientNet jest znany z równoważenia dokładności i zużycia zasobów.
Główny punkt jest prosty. Rodzina modeli wynika z zadania. Klasyfikacja obrazów, generowanie obrazów, segmentacja medyczna i analiza wideo nie wymagają tego samego kształtu rozwiązania. Traktowanie ich jako jednej rzeczy prowadzi do złej architektury i późnych godzin pracy.
Mały przykład: sortowanie zdjęć paczek
Wyobraźmy sobie system pocztowy, który otrzymuje zdjęcia paczek. System musi zdecydować, czy pudełko jest uszkodzone.
Model computer vision można wytrenować na oznaczonych przykładach. Na niektórych zdjęciach widoczne są dobre pudełka. Na innych widoczne są zgniecione rogi, rozdarcia czy zerwana taśma. Model uczy się, które wzorce wizualne często pasują do uszkodzeń. Gdy wpłynie nowe zdjęcie, system daje predykcję.
Brzmi to schludnie i jest użyteczne. Ale limity mają znaczenie. Słabe oświetlenie może ukryć uszkodzenie. Częściowy widok może zwieść model. Rzadki rodzaj opakowania może go zdezorientować. Dlatego prawdziwy system często dodaje reguły, ręczną recenzję lub drugie sprawdzenie w przypadku niepewnych przypadków.
To jest moment, który początkujący przegapują. Model to tylko jeden element procesu pracy. Produkt potrzebuje ścieżki na błędy. Jeśli taka ścieżka nie istnieje, system staje się kruchy bardzo szybko.
Nad czym inżynierowie AI pracują naprawdę
Inżynieria AI to nie tylko wybór modelu. To projektowanie systemu.
Inżynier musi myśleć o tym, skąd pochodzą dane, jak są czyszczone, jak model jest oceniany i jak zachowuje się po wypuszczeniu na rynek. Model może wyglądać solidnie podczas testów, a mimo to zawieść w terenie, ponieważ zmieniły się dane wejściowe. To częste zjawisko. Jest też nudne, przez co łatwo je ignorować, aż zacznie szkodzić.
Istnieje też wyraźna luka między AI demonstracyjną a AI produkcyjną. Demonstracja może być wąska i pobłażliwa. Produkcja jest nieuporządkowana. Dane wejściowe ulegają dryfowi. Użytkownicy zachowują się nietypowo. Pojawiają się przypadki skrajne. Koszty mają znaczenie. Logi mają znaczenie. Monitorowanie ma znaczenie. Model musi przetrwać w świecie rzeczywistym, a nie na slajdach prezentacji.
Dlatego systemy AI i architektura mają takie znaczenie. Model nie jest całym produktem. To komponent wewnątrz większej maszyny. Jeśli maszyna jest źle zbudowana, nawet najmądrzejszy model w pokoju będzie wyglądał głupio.
Co daje Ci ta lekcja
Po tej lekcji potrafisz odróżnić model od systemu. Możesz też zaklasyfikować uczenie maszynowe, computer vision i generatywną AI do właściwego worka według zadania, a nie etykiety marketingowej. Daje ci to czystszy sposób czytania o AI i lepszy sposób myślenia o tym, jak te systemy są budowane.
To jest obietnica, jaką trzymam w The Model Log: jedna praktyczna koncepcja AI, jeden działający przykład i jeden szczery spojrzenie na to, co naprawdę działa.



