Podsumowanie modułu: podstawy CNN i szczegóły oceny

Podsumowanie modułu: podstawy CNN i szczegóły oceny

  • ◉ AI Geek Programmer
  • ◷ 20 września 2026

Jaki problem rozwiązują sieci neuronowe z konwolucjami (CNN), którego zwykłe gęste sieci radzą sobie źle?

Rozwiązują prosty, ale uporczywy problem. Obrazy mają strukturę. Sąsiednie piksele są dla siebie ważniejsze niż te odległe. Model, który ignoruje tę strukturę, marnuje wysiłek i często uczy się niewłaściwych wzorców.

Gęsta sieć postrzega obraz jako jedną długą listę liczb. Działa to w ten sam sposób, w jaki spis telefoniczny opisuje twarz. Każda wartość jest obecna, ale kształt znika. CNN zachowuje obraz ułożony w siatkę i wykorzystuje tę siatkę podczas nauki.

Obraz jest zwykle przechowywany jako tensor. Dla kolorowego zdjęcia ten tensor ma wysokość, szerokość i kanały. Wysokość i szerokość zawierają siatkę pikseli. Kanały przechowują informacje o kolorze, takie jak czerwony, zielony i niebieski. Obraz czarno-biały ma jeden kanał. Kolorowy obraz ma trzy.

Ten kształt ma znaczenie. Sam piksel oznacza niewiele. Mały fragment pikseli może pokazywać róg, pasmo lub część oka. Sieci CNN są zaprojektowane tak, aby najpierw patrzeć na małe fragmenty. Skanują one obraz za pomocą filtra, nazywanego również jądrem (kernel). Filtr to mała macierz uczonych wag. Przesuwa się on po obrazie i generuje mapę cech.

Mapa cech pokazuje, gdzie pojawia się dany wzorzec. Jeśli filtr nauczy się pionowych krawędzi, mapa zaświeci się tam, gdzie istnieją pionowe krawędzie. Inny filtr może reagować na krawędzie poziome. Kolejny może reagować na zmiany koloru lub teksturę. To jest główna idea stojąca za sieciami CNN. Uczą się one użytecznych wzorców wizualnych z danych lokalnych.

Kluczowym słowem jest „lokalny”. Sieć CNN nie musi na początku wymagać, aby każdy piksel rozmawiał z każdym innym pikselem. Uczy się najpierw z otoczenia. Jest to znacznie bliższe temu, jak obrazy działają w praktyce. Ten sam ucho psa może pojawić się w różnych miejscach, a model nadal będzie mógł je wykryć.

Pooling (próbkowanie) często następuje dalej. Pooling zmniejsza rozmiar przestrzenny. Zachowuje najsilniejsze odpowiedzi i odrzuca niektóre detale. Brzmi to surowo, ponieważ tak właśnie jest. Celowo porzuca informacje. Zyskiem jest to, że model staje się mniej wrażliwy na drobne przesunięcia i zużywa mniej pamięci.

Ta konstrukcja tworzy hierarchię. Wczesne warstwy znajdują proste kształty. Średnie warstwy łączą te kształty w części. Głębsze warstwy mogą reprezentować większe struktury, takie jak koła, twarze czy całe obiekty. Model nie „rozumie” tego w ludzkim sensie. Buduje łańcuch detektorów wzorców, który staje się bardziej abstrakcyjny wraz z głębokością.

Mały przykład czyni to konkretnym. Wyobraźmy sobie szarego obraz (5 \times 5) z ciemną pionową linią w środku. Pionowy filtr krawędzi przesuwa się po tym obrazie. Kiedy filtr pokrywa się z ciemną linią, mapa cech daje silną odpowiedź. Kiedy się odsuwa, odpowiedź słabnie. Sieć nie nazwała linii. Zmierzyła ona wzorzec w spójny sposób.

Dlatego sieci CNN często wygrywają z w pełni połączonymi sieciami w zadaniach obrazowych. Gęste sieci mogą nauczyć się reguł wizualnych, ale płacą za to wysoką cenę. Mają znacznie więcej parametrów i brak wbudowanego szacunku dla układu przestrzennego. Sieci CNN dzielą wagi i używają lokalnych filtrów, więc są lżejsze i lepiej dopasowane do danych wizualnych. To dopasowanie ma znaczenie.

Ten sam moduł wychodzi też poza proste etykiety obrazów. Niektóre problemy widzenia komputerowego pytają nie o to „co jest na obrazie?”, ale „gdzie to jest?”. Wykrywanie obiektów odpowiada na to za pomocą ramkujących prostokątów (bounding boxes). Ramka to prostokąt wokół obiektu. Segmentacja idzie głębiej. Przypisuje etykietę każdemu pikselowi, albo przynajmniej każdemu regionowi.

Wykrywanie i segmentacja rozwiązują różne zadania. Wykrywanie jest szybsze i prostsze. Segmentacja dostarcza lepszych szczegółów kształtu. Ramka może powiedzieć, że na kanapie jest kot. Maską można wykreślić kontur kota. Te dodatkowe detale kosztują więcej obliczeń i więcej pracy nad adnotacjami. Systemy wizyjne wybierają na podstawie zadania, a nie dumy.

Intersection over Union, często nazywane IoU, jest powszechnym sposobem oceniania nakładania się obszarów. Porównuje ono przewidywany region z prawdziwym regionem. Wysokie nakładanie się oznacza lepsze dopasowanie. Ta metryka ma znaczenie, ponieważ lokalizacja obiektu jest częścią odpowiedzi, a nie dodatkową notatką. Model, który znajdzie właściwą klasę w złym miejscu, jest nadal błędny.

Innym przydatnym pomysłem we współczesnym widzeniu komputerowym jest uczenie podobieństwa. Tutaj model nie zatrzymuje się na etykietach klas. Uczy się embeddingu, czyli numerycznej reprezentacji, która umieszcza podobne obrazy blisko siebie w wspólnej przestrzeni. Jest to przydatne do wyszukiwania, dopasowywania i grupowania. Jeśli dwa zdjęcia produktów powinny być traktowane jako ten sam przedmiot, model może porównać ich odległości zamiast wymuszać etykietę klasy.

Ta część widzenia korzysta z odległości jako sygnału. Mała odległość oznacza, że obrazy są bliskie pod względem znaczenia. Duża odległość oznacza, że są daleko od siebie. Typowe są tu konfiguracje typu Siamese i triplet. Trenują one model tak, aby zbliżyć podobne obrazy i oddalić różne. Brzmi to prosto. Trudną częścią jest sprawienie, aby przestrzeń embeddingu dobrze zachowywała się na nowych obrazach.

Praktyczna wartość modułu tkwi w połączeniu tych idei. Obrazy to tensory. Sieci CNN czytają te tensory za pomocą lokalnych filtrów. Pooling przycina detale. Głębsze warstwy budują bogatsze cechy. Wykrywanie i segmentacja dodają lokalizację. Uczenie podobieństwa zamienia obrazy w mierzalne punkty w przestrzeni wektorowej. Każdy element rozwiązuje inną część problemu widzenia.

Strona praktyczna też ma znaczenie. Uczestnik, który potrafi zinspectować tensor, przeczytać mapę cech, porównać ramkę z maską i zmierzyć odległość embeddingu, przekroczył rzeczywistą granicę. Ta osoba nie traktuje już widzenia komputerowego jak magii. System jest wciąż złożony i nadal zawodzi w brzydkich sposobach, ale jest mniej tajemniczy.

To jest prawdziwa lekcja tutaj. Gdy tylko struktura obrazów stanie się jasna, sieci CNN przestają wyglądać jak stos haseł marketingowych. Stają się praktyczną odpowiedzią na praktyczny problem. I z tą bazą na miejscu, kolejne kroki w widzeniu komputerowym mają sens, zamiast wydawać się losowymi nazwami modeli sklejonymi razem.

To jest rodzaj jasnego, działającego zrozumienia, które cenię w The Model Log: jeden praktyczny koncept AI, jeden działający przykład i jedna szczera ocena tego, co naprawdę działa.

Tagi:
    Udostępnij:

    Powiązane artykuły

    Sieci neuronowe uczą się wzorców od zera, wykorzystując ważone wejścia

    Sieci neuronowe uczą się wzorców od zera, wykorzystując ważone wejścia

    • AI Geek Programmer
    • 19 września 2026

    A neural network learns by changing numbers, not by finding rules written in advance.

    Czytaj artykuł
    Liderzy produktów AI potrzebują umiejętności projektowania systemów, a nie programowania

    Liderzy produktów AI potrzebują umiejętności projektowania systemów, a nie programowania

    • AI Geek Programmer
    • 18 września 2026

    The real problem is simple: AI product leaders often get judged on code, when the harder job is system design.

    Czytaj artykuł
    Multimodalne transformatory łączą tekst i obrazy dla lepszej sztucznej inteligencji

    Multimodalne transformatory łączą tekst i obrazy dla lepszej sztucznej inteligencji

    • AI Geek Programmer
    • 17 września 2026

    What problem does a system solve when a product has both text and images, but the search engine treats them like separate worlds?

    Czytaj artykuł