Neural Radiance Field (NeRF)

Model ML, który na podstawie zdjęć renderuje sceny 3D z dowolnego punktu widzenia. Tworzy wiarygodne obrazy, ale nie mierzy geometrii, w przeciwieństwie do fotogrametrii.

Czym jest pole promieniowania neuronowego?

Pole promieniowania neuronowego (NeRF – ang. Neural Radiance Field) to model uczenia maszynowego, który uczy się wyglądu sceny na podstawie zbioru nakładających się zdjęć, a następnie renderuje fotorealistyczne widoki z dowolnego punktu wewnątrz lub w pobliżu rejestrowanego obszaru. W przeciwieństwie do tradycyjnego modelowania 3D, które wymaga jawnej geometrii (siatki, powierzchnie, chmury punktów), NeRF koduje scenę jako funkcję ciągłą wewnątrz sieci neuronowej. Gdy zapytasz tę funkcję o kierunek i położenie promienia kamery, zwraca ona radiancję (światło) emitowaną w kierunku kamery w danym punkcie. Efektem jest reprezentacja sceny 3D, która odtwarza szczegóły i oświetlenie, ale nie daje gwarancji co do dokładności geometrycznej ani poprawności wymiarowej.

Jak działa NeRF od strony technicznej?

NeRF reprezentuje scenę za pomocą wielowarstwowej sieci neuronowej, która przyjmuje pięć danych wejściowych: położenie 3D (x, y, z) i kierunek patrzenia (theta, phi), a na wyjściu podaje dwie wartości: gęstość objętościową i radiancję (kolor). Podczas uczenia sieć otrzymuje setki przykładowych promieni z wejściowych zdjęć, z których każdy jest oznaczony rzeczywistym kolorem piksela, jaki powinien wygenerować. Sieć dostosowuje swoje wagi, aby zminimalizować różnicę między swoimi przewidywaniami a prawdziwymi wartościami pikseli. Po wytrenowaniu sieć może syntetyzować widoki z nowych pozycji kamery, rzucając promienie przez wyuczoną scenę i integrując przewidywania radiancji z sieci. Proces ten jest wymagający obliczeniowo: oryginalna praca Mildenhalla i in. z 2020 r. wymagała od 1 do 2 dni pracy GPU na scenę. Nowsze ulepszenia, takie jak Instant-NeRF, skracają ten czas do kilku minut.

Czym NeRF różni się od fotogrametrii?

To rozróżnienie ma znaczenie w praktyce architektonicznej. Fotogrametria (ang. structure-from-motion) przekształca nakładające się zdjęcia w chmurę punktów, siatkę lub objętość wokseli: jawną, mierzalną geometrię, która pozostaje stała niezależnie od kąta patrzenia. Model fotogrametryczny można zaimportować do oprogramowania BIM, zweryfikować wymiary, a geometrię można ponownie wykorzystać w różnych projektach i u klientów. NeRF uczy się reprezentacji zależnej od widoku, która optymalizuje jedynie pod kątem wizualnego prawdopodobieństwa w zarejestrowanych punktach widzenia, w przeciwieństwie do mierzonej geometrii lub podejść obrazów generatywnych. Jego funkcja neuronowa nie jest w stanie bezpośrednio odpowiedzieć na pytanie: „Jaka jest odległość od okna do narożnika?” lub „Czy elewacja jest płaska czy zakrzywiona?”. Fotogrametria daje wiarygodne odpowiedzi na takie pytania; NeRF – nie.

CechaNeRFFotogrametria
WynikNeuronowa funkcja renderowania (zależna od widoku)Chmura punktów, siatka lub geometria wokseli (niezależna od widoku)
Dokładność geometrycznaPrawdopodobna, ale niezweryfikowanaMierzalna; możliwa do walidacji
Możliwość ponownego użyciaTylko w miejscu rejestracjiGeometrię można przenieść do dowolnego oprogramowania
Zapytania wymiaroweNiewiarygodneWiarygodne przy odpowiedniej kalibracji
Czas przetwarzaniaMinuty do godzin (z akceleracją)Godziny do dni (zależy od objętości danych)

Jak NeRF wypada w porównaniu z rozpraszaniem gaussowskim?

Obie metody to neuronowe techniki rekonstrukcji 3D uczone na podstawie zdjęć z wielu widoków i obie unikają żmudnego ręcznego modelowania 3D. Podstawowa różnica polega na reprezentacji: NeRF używa ciągłej funkcji niejawnej (sieci neuronowej, którą gęsto odpytywano), natomiast rozpraszanie gaussowskie wykorzystuje jawny zestaw wyuczonych gaussianów 3D, które są rasteryzowane bezpośrednio do 2D. Dzięki temu rozpraszanie gaussowskie jest znacznie szybsze w renderowaniu (często w czasie rzeczywistym z szybkością 60 klatek na sekundę w przeglądarce VR), ale może wykazywać artefakty pojawiania się i zmiany w czasie, gdy kamera porusza się przez lub w pobliżu splotu. NeRF jest wolniejszy w renderowaniu (często od 5 do 30 sekund na klatkę), ale generuje gładsze, bardziej fotorealistyczne pojedyncze obrazy. Do wizualizacji architektonicznej wybierz NeRF, jeśli potrzebujesz najlepiej wyglądającego statycznego renderu do prezentacji klienta lub dokumentacji dziedzictwa kulturowego; wybierz rozpraszanie gaussowskie, jeśli potrzebujesz interaktywnych spacerów w czasie rzeczywistym lub wydajności w zestawie VR.

Jakie są ograniczenia i uczciwe przypadki użycia?

NeRF doskonale radzi sobie z renderowaniem z nowych punktów widzenia, ale nie tworzy mierzonej inwentaryzacji. Klient widzący spacer NeRF wokół swojej rozbudowy budynku powinien rozumieć to jako wizualizację wyglądu, a nie dowód zgodności wymiarowej. NeRF nie może być używany do weryfikacji, czy okno pasuje do otworu, czy klatka schodowa spełnia przepisy lub czy elewacja jest zgodna z liniami zabudowy. Jest również bardzo wymagający pod względem danych treningowych: słabe oświetlenie, powtarzalne wzory lub cienkie elementy (takie jak poręcze) często powodują artefakty. Proces rejestracji wymaga wielu nakładających się zdjęć z dokładnie zaplanowanej ścieżki wokół obiektu; zdjęcia ręczne są możliwe, ale lepsze wyniki dają zdjęcia z drona lub ze strukturalnych ścieżek. W przypadku 50-metrowej elewacji o złożonej geometrii może być potrzebnych od 100 do 200 zdjęć i kilka godzin treningu.

ZastosowanieCzy nadaje się do NeRF?Dlaczego tak lub nie
Wizualizacja kontekstu działkiTakJedna zwykła sesja zdjęciowa; klient ogląda istniejące otoczenie w VR.
Dokumentacja budynku zabytkowegoTakSzybkie przechwytywanie 3D bez inwazyjnego skanowania; archiwizacja fotorealistyczna.
Spacer po wnętrzuTakSesja zdjęciowa w jednym pomieszczeniu tworzy przekonującą wycieczkę VR.
Weryfikacja wymiarowaNieReprezentacja neuronowa nie jest metrycznie niezawodna.
Przegląd zgodności z przepisamiNieGeometria jest domniemana, a nie jawna; nie można zmierzyć krytycznych wymiarów.
Import do BIM w stanie istniejącymNieWynik NeRF nie ma charakteru geometrycznego; nie można go modelować ani edytować.
Oferta nieruchomościTakTrasa 3D ze standardowej sesji zdjęciowej; szybsza i tańsza niż dron/LiDAR.

Jakie narzędzia i przepływy pracy powinni znać architekci?

Komercyjne i profesjonalne narzędzia NeRF szybko dojrzewają. Usługi internetowe (Luma AI, Cinematic 360, RealityScan) przyjmują przesłane zdjęcia i generują interaktywne modele 3D bez konieczności konfiguracji GPU; przetwarzanie trwa od kilku godzin do kilku dni. Frameworki open-source (Instant-NeRF, NeRF-PyTorch) działają na lokalnych lub chmurowych procesorach GPU i oferują większą kontrolę nad parametrami uczenia. Niektóre platformy fotogrametryczne (Metashape, Pix4D) dodają renderowanie neuronowe jako alternatywny tryb wyjściowy. Dla architektów praktyczny przepływ pracy wygląda następująco: wykonaj od 50 do 100 nakładających się zdjęć smartfonem lub aparatem cyfrowym w dobrym świetle dziennym; prześlij do chmurowego serwisu NeRF; w ciągu 24 do 48 godzin otrzymasz przeglądany model 3D, który możesz osadzić w prezentacji, platformie VR lub stronie internetowej klienta. Film ze spaceru można wygenerować automatycznie z modelu NeRF. Koszt wynosi zwykle od 5 do 50 euro za scenę.

Integracja z przepływem pracy w projektowaniu dopiero się pojawia. Niektóre biura architektoniczne fotografują istniejące miejsca, trenują NeRF, a następnie komponują projekt klienta w kontekście NeRF za pomocą edytora 3D lub narzędzia do mieszania. Daje to fotorealistyczną integrację z miejscem szybciej niż ręczne teksturowanie siatki fotogrametrycznej lub renderowanie projektu na tle obrazu.

Najczęściej zadawane pytania

Czym NeRF różni się od fotogrametrii?
Fotogrametria przekształca nakładające się zdjęcia w chmurę punktów lub siatkę: zmierzoną geometrię, która jest stała we wszystkich punktach widzenia. NeRF uczy sieć neuronową generującą wiarygodne widoki z dowolnego kąta, ale reprezentacja jest niejawna i zależna od widoku. Fotogrametria daje wielokrotnego użytku model geometryczny; NeRF tworzy silnik renderujący, działający tylko w miejscu wykonania zdjęć. Żadne z nich nie zastępuje geodezyjnego pomiaru sytuacyjnego ani elewacji.
Jaka jest różnica między NeRF a splattingiem Gaussa?
Oba to neuronowe reprezentacje scen 3D uczone z nakładających się zdjęć. NeRF koduje scenę jako ciągłą funkcję objętościową (sieć neuronową), którą ray tracer odczytuje; renderowanie jest wolne, ale ciągłe i gładkie. Splatting Gaussa reprezentuje scenę jako miliony wyuczonych 3D rozmyć Gaussa rasteryzowanych do 2D; renderuje znacznie szybciej, ale jest dyskretny i może wykazywać artefakty przeskakiwania. W wizualizacji architektonicznej NeRF jest lepszy do fotorealistycznych nieruchomych obrazów; splatting Gaussa lepszy do interaktywnych spacerów.
Czy NeRF może zastąpić geodezyjną inwentaryzację lub dokumentację powykonawczą?
Nie. NeRF odtwarza wygląd, a nie geometrię. Doskonale nadaje się do renderowania z nowych punktów widzenia, ale grubość ściany, dokładne współrzędne narożnika budynku czy wymiary okna elewacyjnego nie są wiarygodnie uchwycone. Do dokumentacji zabytków lub wizualizacji dla klienta NeRF jest świetny. Do decyzji projektowych lub zgodności z przepisami potrzebujesz tradycyjnego pomiaru lub fotogrametrycznej chmury punktów z weryfikacją wymiarów.
Ile zdjęć potrzebuje NeRF?
Zazwyczaj od 20 do 100+ nakładających się obrazów z różnych kątów, w zależności od złożoności sceny i pożądanej jakości. Zdjęcia muszą mieć znaczne nakładanie i być wykonane z mniej więcej okrężnej lub spiralnej ścieżki wokół obiektu. Środowiska dobrze oświetlone i bogate w tekstury zbiegają się szybciej niż ciemne lub geometrycznie proste przestrzenie. Czas przetwarzania wynosi od minut do godzin na GPU.
Jakie są praktyczne zastosowania NeRF w architekturze?
Dokumentacja kontekstu miejsca: sfotografowanie otoczenia miejskiego zwykłym aparatem, a następnie spacerowanie po modelu w VR, aby zrozumieć nasłonecznienie i widoki. Dokumentacja dziedzictwa: szybkie przechwytywanie 3D istniejących budynków lub wnętrz bez inwazyjnego skanowania. Wizualizacja dla klienta: filmy spacerowe z dowolnego kąta, obliczone po jednej sesji zdjęciowej. Ulepszanie ofert nieruchomości: wycieczki 3D z przypadkowej sesji zdjęciowej, bez drona ani LiDAR.
Jakie oprogramowanie lub narzędzia mogę użyć do trenowania i wdrażania NeRF?
Otwartoźródłowe implementacje obejmują NeRF-PyTorch i Instant-NeRF (NVIDIA); usługi w chmurze, takie jak Luma AI i Cinematic 360, oferują trenowanie i przeglądanie NeRF przez przeglądarkę. Niektóre programy fotogrametryczne (np. Metashape) zaczynają dodawać tryby renderowania neuronowego. Do zastosowań architektonicznych wąskim gardłem jest zazwyczaj konfiguracja i interpretacja, a nie dostępność oprogramowania; dlatego zacznij od zarządzanej usługi w chmurze.