299 research outputs found

    A Deep Learning Based Approach for Detecting Change of Buildings from Aerial Images

    No full text
    Fremveksten i bruken av dyplæringsmetoder for bygning- og endringsdeteksjon har økt jevnt de siste årene. Tilgjengeligheten og kvaliteten til høyoppløselige satellittbilder har tilrettelagt for en rekke muligheter innenfor praktiske bruksområder og forretningsproblemer. Deteksjon av endringer ved hjelp av satellittbilder med høy oppløsning har hatt en viktig rolle i å kartlegge endringer på jordas overflate. På grunn av økende interesse for bygning og endringsdeteksjon, har en rekke forskjellige tilnærminger på dette feltet blitt lett tilgjengelige. Denne oppgaven introduserer et nytt nevralt nettverk, U-PSP-Net, spesielt designet for bygningsdeteksjon. Nettverket brukes til å oppdage endringer av bygninger i Trondheim kommune. Oppgaven dekker også etableringen av et nytt bygningsdatasett som dekker 2,3 kvadratkilometer og 3784 bygninger. U-PSP-Net er et konvolusjonalt nevralt nettverk laget ved å kombinere deler fra U-Net og PSPNet, to andre bildesegmenteringsnettverk. En ablasjonsstudie ble utført for å optimere nettverket, og å utnytte fordelene ved hvert nettverk samtidig som de minimerte deres svakheter. Det resulterende nettverket er fire lag dypt med en pyramidepoolingsmodul, bestående av de to minste kjernene, som forbinder koder- og dekoderstrukturene. Redusering av dybden gjør U-PSP-Net til et mer effektivt nettverk, som bruker bare halvparten så mange vekter sammenlignet med U-Net. Nettverket oppnådde nesten 98\% dekning og presisjon og en IoU på nesten 97\%. Som en del av oppgaven, ble det gjennomført en eksperimentell studie i Trondheim. Målet var å bruke U-PSP-Net til å så nøyaktig som mulig kunne detektere bygninger fra flybilder. Nettverket ble brukt til å detektere bygninger fra to ulike datasett. Resultatene var svært nøyaktige, men med noen feilklassifiseringer på det ene datasettet. De klassifiserte bildene ble senere brukt til analyse av endring. Under analysen, oppstod det problemer forårsaket av forskjeller i datasettene på grunn av variasjon i bildeinnsamlingsfasen. For å konkludere, viste U-PSP-Net seg å være effektivt ved bygningsdeteksjon, men treningsdatasettet burde utvides og bildene bør eksponeres for mer behandling. Metoden for endringsdeteksjon har også vist seg å fungere, selv om det kreves sanne ortofoto for en automatisk deteksjon. Den komplette kildekoden utviklet for denne oppgaven ligger på \underline{\href{https://github.com/martinwe001/Master_Thesis_CNN}{GitHub}}.The rise of deep learning approaches for building and change detection have increased in the recent years. The accessibility and quality of high resolution satellite images have opened a wide variety of possibilities for practical applications and business problems. Temporal change detection using high resolution satellite images, have played an important role in mapping different changes on Earth's surface. Due to increasing interest in building and change detection, a range of different approaches in this field have become readily available. This thesis introduces a novel neural network, U-PSP-Net, specifically designed for building detection. The network is used to detect changes of buildings in Trondheim Municipality. The thesis also covers the creation of a novel building data set covering 2.3 square kilometers and 3784 buildings. U-PSP-Net is a convolution neural network made by combining parts from U-Net and PSPNet, two other image segmentation networks. An ablation study was performed to optimize the network, exploiting the advantages of each network while also minimizing their weaknesses. The resulting network is four layers deep with a pyramid pooling module, consisting of the two smallest kernels, connecting the encoder and decoder structures. Reducing the depth makes U-PSP-Net a more efficient network, using only half as many weights as U-Net. The network achieved almost 98\% recall and precision and a IoU of almost 97 \%. As part of the thesis, an experimental study in Trondheim was conducted. The goal was to use U-PSP-Net to, as accurately as possible, extract buildings from aerial images. The network was used to extract buildings from two data sets. Despite the high accuracy of the results, some misclassifications were made on the data sets. The classified images were later used for change detection analysis. The analysis encounters issues caused by differences in the data sets due to variation in the image collection phase. In conclusion, the U-PSP-Net proved to be efficient at building detection. However, the training data set could be expanded, and the images should be exposed to more augmentation. The change detection method was also proven to work, although, for automatic detection, true orthophotos are required. The complete source code developed for this thesis can be found at \underline{\href{https://github.com/martinwe001/Master_Thesis_CNN}{this}} GitHub repositor

    Semi-Supervised Learning from Street-View Images and OpenStreetMap for Automatic Building Height Estimation

    Get PDF
    Accurate building height estimation is key to the automatic derivation of 3D city models from emerging big geospatial data, including Volunteered Geographical Information (VGI). However, an automatic solution for large-scale building height estimation based on low-cost VGI data is currently missing. The fast development of VGI data platforms, especially OpenStreetMap (OSM) and crowdsourced street-view images (SVI), offers a stimulating opportunity to fill this research gap. In this work, we propose a semi-supervised learning (SSL) method of automatically estimating building height from Mapillary SVI and OSM data to generate low-cost and open-source 3D city modeling in LoD1. The proposed method consists of three parts: first, we propose an SSL schema with the option of setting a different ratio of "pseudo label" during the supervised regression; second, we extract multi-level morphometric features from OSM data (i.e., buildings and streets) for the purposed of inferring building height; last, we design a building floor estimation workflow with a pre-trained facade object detection network to generate "pseudo label" from SVI and assign it to the corresponding OSM building footprint. In a case study, we validate the proposed SSL method in the city of Heidelberg, Germany and evaluate the model performance against the reference data of building heights. Based on three different regression models, namely Random Forest (RF), Support Vector Machine (SVM), and Convolutional Neural Network (CNN), the SSL method leads to a clear performance boosting in estimating building heights with a Mean Absolute Error (MAE) around 2.1 meters, which is competitive to state-of-the-art approaches. The preliminary result is promising and motivates our future work in scaling up the proposed method based on low-cost VGI data, with possibilities in even regions and areas with diverse data quality and availability

    TR3DRoofs: A Urban Roof Datase - A New Dataset for Deep Learning-based Segmentation of Roof Structures in LiDAR Point Clouds

    No full text
    Stadig blir behovet for tiltak for å redusere effekten av klimaendringene mer kritisk. Ved å fremme bruken av fornybar energi, kan man sørge for opptil 90% av CO2 reduksjonene som behøves innen 2050. Betydningen av 3D data blir stadig tydeligere innenfor dette fagfeltet, da detaljerte modeller kreves for å gjøre dagens moderne byer mer effektive og miljøvennlige. I denne oppgaven ønsker vi å bidra til å tilgjengeliggjøre 3D data ved å utforske anvendbarheten til punktsky-data i en av dagens største trender innenfor automatiserings-teknologi, kunstig intelligens. Vi vil spesifikt sette et søkelys på automatisering av segmenterings-steget i etableringen av 3D modeller av tak-strukturer. Vi presenterer her et nytt datasett for bruk i dyp læring ment for å utføre semantisk segmentering av 3D-punktskyer bestående av tak-strukturer. Vårt mål er å tilby et datasett av høy kvalitet, basert på ekte tak-strukturer, som skal resultere i gode prediksjoner av tak-segmenter, og være anvendbart for bruk i Norge. Datasettet er basert på "Light Detection and Ranging" (LiDAR) data, samlet inn over Trondheim kommune. To ulike versjoner av datasettet er etablert. Det originale datasettet består av 906 tak i Trondheims-området. Begge datasett inneholder punkt manuelt annotert med én av syv definerte taktyper, samt en videre inndeling i individuelle takplan. Metoder for å utføre data augmentering er foreslått og anvendt for å etablere en alternativ versjon av datasettet med flere treningseksempler. Videre er datasettets egnethet for bruk i trening av dype neurale nettverk evaluert ved hjelp av et velkjent nettverk for prosessering av punktskyer, PointNet++. En stor del av det augmenterte datasettet er brukt for treningen av nettverket, før testing er gjennomført på den gjenværende delen. Resultatet fra denne prosessen er predikerte segmenter av tak-strukturer inndelt i ulike plan. Resultatene indikerer at vårt 3D-datasett er velegnet for å trene dype neurale nettverk. I tillegg finner vi indikasjoner på at dyp læring kan være gunstig i automatiseringen av segmenteringssteget i etableringen av 3D modeller.Measures to reduce the impact of climate change are becoming more and more critical. By increasing the use of renewable energy, up to 90% of the CO2 emission reductions needed by 2050 can be achieved. The importance of 3D data is becoming increasingly more evident in this field, as modern cities require detailed models as a tool for in-depth planning to be both efficient and environmentally friendly. In this thesis, we want to help contribute to make applications that use 3D data more accessible by exploring the applicability of one of today's biggest technology trends within automation, AI, on point cloud data. Specifically, we focus on the automation of the segmentation necessary for creation of 3D models of roof structures. We present a new dataset to be used for the task of 3D point cloud part segmentation of roof structures using deep learning. The goal is to propose a high-quality dataset based on real-life structures, yielding predictions of roof segmentations appropriate for applications in Norway. The dataset is established from Light Detection and Ranging (LiDAR) data, collected across Trondheim municipality. Two versions of the dataset are proposed. The original dataset consists of 906 roofs present in the Trondheim area, and both datasets contain points manually annotated with one out of seven defined roof types, and further labelled into individual roof planes. Data augmentation methods is proposed and implemented to produce an alternative version of the dataset that is large enough for training purposes. To evaluate the suitability of our dataset for the use in the training of a deep neural network, we adopt a recognized network for point cloud processing, PointNet++, and train it using the augmented dataset. The trained network is tested on a portion of the dataset, which results in a predicted plane segmentation of roof structures. The results indicate that our 3D dataset is suitable for training of a deep neural network. In addition, this indicates that deep learning proves to be promising in automation of the segmentation step in 3D modeling

    Deep Tree Detector - A New Method for Detecting Individual Trees from ALS Data Using Projected Features and Deep Learning

    Get PDF
    Å ha oppdaterte databaser med individuelle trær er nyttig både i skogforvaltning og økologisk forskning. Manuell deteksjon og digital innsamling av enkelttrær er både tidkrevende og dyrt. I denne studien undersøkes metoder for å automatisk detektere trær gjennom luftbåren laserskanning. I masteroppgaven blir også en ny metode for å oppdage trær fra disse fjernmålingene foreslått. Metoden kombinerer metoder fra visuell intelligens, som baserer seg på todimensjonell data, med detaljerte tredimensjonale datasett, fanget med luftbåren lidar. Metoden går ut på å projisere punktskyene på et raster i XY-planet for å danne todimensjonale bilder. Den romlige informasjonen blir bevart gjennom å projisere viktige egenskaper fra punktskyen, og lagre disse verdiene i båndene i bildet. Båndene i bildet som vanligvis blir brukt for å holde rødfarge, grønnfarge og blåfarge blir erstattet med henholdsvis punktetthet, høydedifferanse og høydegradient. For å løse kravet om store mengder annotert data i dyp læring, har et syntetisk datasett blitt skapt gjennom omfattende dataaugmentering. En Mask R-CNN modell har blitt trent på det syntetiske datasettet og blitt testet på reell data fra et skannet område i Trondheim. Modellen ble også testet på et syntetisk testsett som ble lagd på samme måtet som treningssettet, men med andre trær. Den ferdige modellen når en presisjonsverdi på 82% og en tilbakekallingsverdi på 82% på det reelle testsettet. På det syntetiske testsettet når modellen en presisjon og tilbakekalling på henholdsvis 97,2% og 96,1%. Resultatene viser at den foreslåtte metoden er i stand til å oppdage flere trær, med høyere presisjon enn tradisjonelle metoder, og legger seg i sjiktet blant andre metoder basert på dyp-læring.Having an up-to-date tree inventory in a forest or a city is valuable for forest monitoring and ecological research. Manually detecting individual trees for these inventories is time-consuming and costly work. In this study methods for automatically detecting trees from ALS data are researched. A new method for detecting individual trees is created by combining deep learning models from the realm of visual intelligence with the rich point clouds gathered through remote sensing. The proposed method is based on projecting point clouds onto a rasterized XY-plane, creating images from the point clouds. The spatial information is preserved by projecting valuable features from the point cloud onto the image. The values are then stored on the image-channels. A synthetic dataset is created using extensive data augmentation, to account for the lack of labelled data available. A Mask-RCNN model is trained on the synthetic images, and is tested on real data from a scanned area in Trondheim. The trained model reaches a precision and recall of 82% and 82% respectively, on the test area. The model was also tested on a synthetic test set, containing sampled trees not seen during training, arbitrarily positioned on a grid. The model reaches a precision and recall of 97,2% and 96,1% respectively, on the synthetic test set. The results show that this method is more than able to compete with traditional non-deep-learning methods for detecting individual trees

    Estimating the Height of Facades with Street-level Imagery using Facade Parsing, Floor Segmentation, and Urban Rules

    No full text
    Fasadehøyde er en vesentlig faktor i studiet av bymiljøets karakter og omfang. Estimering av høyde krever nøyaktige romlige målinger og komplett bygningsdata, der begge avhenger av bruken av dyr og toppmoderne teknologi. Denne studien har som mål å senke terskelen for å gjennomføre storskala høydeestimering ved å benytte seg av lett tilgjengelig teknologi. Hovedsakelig ønsker vi å undersøke hvordan bilder tatt fra gatenivå kan benyttes for å estimere fasadehøyden i et større geografisk område. Dette gjennomføres ved å utnytte symmetri og repeterende mønstre basert på arkitektoniske prinsipper. Vi implementerer en metode som automatisk segmenterer fasadene i separate etasjer og bruker kunnskap om deres iboende egenskaper og attributter for å estimere fasadehøyden. Et eksperimentell studie ble gjennomført i den hensikt for å teste metoden på bilder tatt fra gatenivå i Trondheim, Norge. Fasadeobjektene ble automatisk detektert for å videre segmentere etasjene med et regresjonsanalyseverktøy (RANSAC) og deretter ved å anvende våre definerte urbane regler for å ytterligere justere den resulterende høyden. Resultatene indikerte at segmentering av etasjer bidro til en nøyaktig estimering av fasadehøyden og at reglene supplerte med å styrke høydestimasjonen. Det ble videre gjort kjent at kvaliteten på bildene fra gatenivå i stor grad påvirket resultatene. Evaluering av metoden resulterte i en korrekthet på 92% for eteasjesegmentering på et utvalg bilder med god kvailtet. Videre ble det oppnådd tilfredsstillende resultater for høydestimasjonen i hele studieområdet, med gradvis større feil etter hvert som byggehøyden økte.Facade height is a key variable in studying the character and scale of urban environments. However, accurately estimating the height requires high spatial accuracy and complete building data, dependent on expensive and advanced state-of-the-art methods. This study aims to lower the threshold for large-scale height estimation by using more accessible technology. Specifically, we investigate how we can use street-level imagery to estimate the facade height in a wider geographical region by exploiting architectural principles, including symmetry and repetitive patterns. In addition, we implement a method that automatically segments the facades into separate floors and use extensive knowledge of their inherent features and attributes to estimate the facade height. To test our pipeline, we conducted an experimental study on street view imagery in a contained geographical area of Trondheim, Norway. We automatically detected facade objects to segment the floors with a RANSAC regressor and then applied a set of defined urban rules to adjust the resulting height further. The results indicated that segmenting the floors contributed to an accurate estimation of the facade height and that the rules aided in adjusting the height estimation. We also discovered that the quality of street view imagery significantly influenced the results. Finally, to evaluate the method, we considered an optimal subset of imagery and found that the correctness of the floor segmentation was 92%. Furthermore, we achieved adequate results regarding the height estimation in the whole study area, with progressively larger errors as the building height increased

    TR3DRoofs: A Urban Roof Datase - A New Dataset for Deep Learning-based Segmentation of Roof Structures in LiDAR Point Clouds

    No full text
    Stadig blir behovet for tiltak for å redusere effekten av klimaendringene mer kritisk. Ved å fremme bruken av fornybar energi, kan man sørge for opptil 90% av CO2 reduksjonene som behøves innen 2050. Betydningen av 3D data blir stadig tydeligere innenfor dette fagfeltet, da detaljerte modeller kreves for å gjøre dagens moderne byer mer effektive og miljøvennlige. I denne oppgaven ønsker vi å bidra til å tilgjengeliggjøre 3D data ved å utforske anvendbarheten til punktsky-data i en av dagens største trender innenfor automatiserings-teknologi, kunstig intelligens. Vi vil spesifikt sette et søkelys på automatisering av segmenterings-steget i etableringen av 3D modeller av tak-strukturer. Vi presenterer her et nytt datasett for bruk i dyp læring ment for å utføre semantisk segmentering av 3D-punktskyer bestående av tak-strukturer. Vårt mål er å tilby et datasett av høy kvalitet, basert på ekte tak-strukturer, som skal resultere i gode prediksjoner av tak-segmenter, og være anvendbart for bruk i Norge. Datasettet er basert på "Light Detection and Ranging" (LiDAR) data, samlet inn over Trondheim kommune. To ulike versjoner av datasettet er etablert. Det originale datasettet består av 906 tak i Trondheims-området. Begge datasett inneholder punkt manuelt annotert med én av syv definerte taktyper, samt en videre inndeling i individuelle takplan. Metoder for å utføre data augmentering er foreslått og anvendt for å etablere en alternativ versjon av datasettet med flere treningseksempler. Videre er datasettets egnethet for bruk i trening av dype neurale nettverk evaluert ved hjelp av et velkjent nettverk for prosessering av punktskyer, PointNet++. En stor del av det augmenterte datasettet er brukt for treningen av nettverket, før testing er gjennomført på den gjenværende delen. Resultatet fra denne prosessen er predikerte segmenter av tak-strukturer inndelt i ulike plan. Resultatene indikerer at vårt 3D-datasett er velegnet for å trene dype neurale nettverk. I tillegg finner vi indikasjoner på at dyp læring kan være gunstig i automatiseringen av segmenteringssteget i etableringen av 3D modeller

    Estimating the Height of Facades with Street-level Imagery using Facade Parsing, Floor Segmentation, and Urban Rules

    No full text
    Fasadehøyde er en vesentlig faktor i studiet av bymiljøets karakter og omfang. Estimering av høyde krever nøyaktige romlige målinger og komplett bygningsdata, der begge avhenger av bruken av dyr og toppmoderne teknologi. Denne studien har som mål å senke terskelen for å gjennomføre storskala høydeestimering ved å benytte seg av lett tilgjengelig teknologi. Hovedsakelig ønsker vi å undersøke hvordan bilder tatt fra gatenivå kan benyttes for å estimere fasadehøyden i et større geografisk område. Dette gjennomføres ved å utnytte symmetri og repeterende mønstre basert på arkitektoniske prinsipper. Vi implementerer en metode som automatisk segmenterer fasadene i separate etasjer og bruker kunnskap om deres iboende egenskaper og attributter for å estimere fasadehøyden. Et eksperimentell studie ble gjennomført i den hensikt for å teste metoden på bilder tatt fra gatenivå i Trondheim, Norge. Fasadeobjektene ble automatisk detektert for å videre segmentere etasjene med et regresjonsanalyseverktøy (RANSAC) og deretter ved å anvende våre definerte urbane regler for å ytterligere justere den resulterende høyden. Resultatene indikerte at segmentering av etasjer bidro til en nøyaktig estimering av fasadehøyden og at reglene supplerte med å styrke høydestimasjonen. Det ble videre gjort kjent at kvaliteten på bildene fra gatenivå i stor grad påvirket resultatene. Evaluering av metoden resulterte i en korrekthet på 92% for eteasjesegmentering på et utvalg bilder med god kvailtet. Videre ble det oppnådd tilfredsstillende resultater for høydestimasjonen i hele studieområdet, med gradvis større feil etter hvert som byggehøyden økte.Facade height is a key variable in studying the character and scale of urban environments. However, accurately estimating the height requires high spatial accuracy and complete building data, dependent on expensive and advanced state-of-the-art methods. This study aims to lower the threshold for large-scale height estimation by using more accessible technology. Specifically, we investigate how we can use street-level imagery to estimate the facade height in a wider geographical region by exploiting architectural principles, including symmetry and repetitive patterns. In addition, we implement a method that automatically segments the facades into separate floors and use extensive knowledge of their inherent features and attributes to estimate the facade height. To test our pipeline, we conducted an experimental study on street view imagery in a contained geographical area of Trondheim, Norway. We automatically detected facade objects to segment the floors with a RANSAC regressor and then applied a set of defined urban rules to adjust the resulting height further. The results indicated that segmenting the floors contributed to an accurate estimation of the facade height and that the rules aided in adjusting the height estimation. We also discovered that the quality of street view imagery significantly influenced the results. Finally, to evaluate the method, we considered an optimal subset of imagery and found that the correctness of the floor segmentation was 92%. Furthermore, we achieved adequate results regarding the height estimation in the whole study area, with progressively larger errors as the building height increased

    Estimating the Height of Facades with Street-level Imagery using Facade Parsing, Floor Segmentation, and Urban Rules

    No full text
    Fasadehøyde er en vesentlig faktor i studiet av bymiljøets karakter og omfang. Estimering av høyde krever nøyaktige romlige målinger og komplett bygningsdata, der begge avhenger av bruken av dyr og toppmoderne teknologi. Denne studien har som mål å senke terskelen for å gjennomføre storskala høydeestimering ved å benytte seg av lett tilgjengelig teknologi. Hovedsakelig ønsker vi å undersøke hvordan bilder tatt fra gatenivå kan benyttes for å estimere fasadehøyden i et større geografisk område. Dette gjennomføres ved å utnytte symmetri og repeterende mønstre basert på arkitektoniske prinsipper. Vi implementerer en metode som automatisk segmenterer fasadene i separate etasjer og bruker kunnskap om deres iboende egenskaper og attributter for å estimere fasadehøyden. Et eksperimentell studie ble gjennomført i den hensikt for å teste metoden på bilder tatt fra gatenivå i Trondheim, Norge. Fasadeobjektene ble automatisk detektert for å videre segmentere etasjene med et regresjonsanalyseverktøy (RANSAC) og deretter ved å anvende våre definerte urbane regler for å ytterligere justere den resulterende høyden. Resultatene indikerte at segmentering av etasjer bidro til en nøyaktig estimering av fasadehøyden og at reglene supplerte med å styrke høydestimasjonen. Det ble videre gjort kjent at kvaliteten på bildene fra gatenivå i stor grad påvirket resultatene. Evaluering av metoden resulterte i en korrekthet på 92% for eteasjesegmentering på et utvalg bilder med god kvailtet. Videre ble det oppnådd tilfredsstillende resultater for høydestimasjonen i hele studieområdet, med gradvis større feil etter hvert som byggehøyden økte

    A Deep Learning Based Approach for Detecting Change of Buildings from Aerial Images

    No full text
    Fremveksten i bruken av dyplæringsmetoder for bygning- og endringsdeteksjon har økt jevnt de siste ̊arene. Tilgjengeligheten og kvaliteten til høyoppløselige satellittbilder har tilrettelagt for en rekke muligheter innenfor praktiske bruksomr ̊ader og forretningsproblemer. Deteksjon av endringer ved hjelp av satellittbilder med høy oppløsning har hatt en viktig rolle i ̊a kartlegge endringer p ̊a jordas overflate. P ̊a grunn av økende interesse for bygning og endringsdeteksjon, har en rekke forskjellige tilnærminger p ̊a dette feltet blitt lett tilgjengelige. Denne oppgaven introduserer et nytt nevralt nettverk, U-PSP-Net, spesielt designet for bygningsdeteksjon. Nettverket brukes til ̊a oppdage endringer av bygninger i Trondheim kommune. Oppgaven dekker ogs ̊a etableringen av et nytt bygningsdatasett som dekker 2,3 kvadratkilometer og 3784 bygninger. U-PSP-Net er et konvolusjonalt nevralt nettverk laget ved ̊a kombinere deler fra U-Net og PSPNet, to andre bildesegmenteringsnettverk. En ablasjonsstudie ble utført for ̊a optimere nettverket, og ̊a utnytte fordelene ved hvert nettverk samtidig som de minimerte deres svakheter. Det resulterende nettverket er fire lag dypt med en pyramidepoolingsmodul, best ̊aende av de to minste kjernene, som forbinder koder- og dekoderstrukturene. Redusering av dybden gjør U-PSP-Net til et mer effektivt nettverk, som bruker bare halvparten s ̊a mange vekter sammenlignet med U-Net. Nettverket oppn ̊adde nesten 98% dekning og presisjon og en IoU p ̊a nesten 97%. Som en del av oppgaven, ble det gjennomført en eksperimentell studie i Trondheim. M ̊alet var ̊a bruke U-PSP-Net til ̊a s ̊a nøyaktig som mulig kunne detektere bygninger fra flybilder. Nettverket ble brukt til ̊a detektere bygninger fra to ulike datasett. Resultatene var svært nøyaktige, men med noen feilklassifiseringer p ̊a det ene datasettet. De klassifiserte bildene ble senere brukt til analyse av endring. Under analysen, oppstod det problemer for ̊arsaket av forskjeller i datasettene p ̊a grunn av variasjon i bildeinnsamlingsfasen. For ̊a konkludere, viste U-PSP-Net seg ̊a være effektivt ved bygningsdeteksjon, men treningsdatasettet burde utvides og bildene bør eksponeres for mer behandling. Metoden for endringsdeteksjon har ogs ̊a vist seg ̊a fungere, selv om det kreves sanne ortofoto for en automatisk deteksjon. Den komplette kildekoden utviklet for denne oppgaven ligger p ̊a GitHub

    Towards creating a map layer of road intersections by information extraction from Mapillary images

    No full text
    Geografisk data er viktig for å forstå romlige relasjoner. Mange av dagens open-source databaser for GPS og romlige spørringer inneholder lite, til ingen data om den romlige konteksten i vegkryss. Ved å øke informasjonen i et vegkryss kan man i stede for å prosessere omgivelsene on-the-fly gjennom objektgjenkjenning, bruke ferdig prosessert data knyttet til hvert vegkryss og potensielt redusere behovet for enorme beregningsressurser, ettersom feltet innenfor objektgjenkjenning og enorme databaser konstant gjøres mer og mer kompleks. Denne oppgaven fremlegger et forslag på et rammerverk som kan brukes til å beregne posisjonen til objekter funnet i bilder fra en av verdens største romlige street-view bildedatabaser Mapillery. Rammeverket fremlegger først en analyse av dagens state-of-the-art teknologier for bildegjenkjenning, og velger den beste av disse for å trene opp et nettverk for å kjenne igjen traffikskilter i bilder. I tillegg brukes et ferdid trent nettverk for å lokalisere traffiklysene i bilder. Utifra disse objektene, utføres en monokulær dybdeestimasjon gjennom et trent nettverk, som brukes til å beregne en dybdeforskjell i pixelrommet. Videre fremstilles det antagelser for størrelser for kjente objekter for å beregne en pixel-til-meter algoritme for å kalkulere posisjonen til det gjenkjente objektet. Når bildet er ferdig prosessert og objektene er gitt en posisjon, plasseres det i et enten eksisterende vegkryss, eller det opprettes et nytt vegkryss ved å benytte seg av informasjon fra open-source vegdatabase APIer. Informasjonen innhentet igjennom rammeverket returneres som et kartlag i form av et GeoJSON objekt.Geographical data is important to understand spatial relations. Many of today’s open-source databases for GPS and spatial queries contains little to no information of the spatial context in an intersection. By increasing the information in an intersection, one can replace the need to process the surrounding environment one-the-fly through object detection by using preprocessed data stored in each intersection. This can reduce the limiting factor of computational resources, as the field of object detection and enormous databases constantly are made more and more complex. This paper proposes a framework that can be used to estimate the position of detected objects in images from one of the worlds largest spatial streetview image database Mapillary. The framework first proposes an overview of the current state-of-the-art technologies for object detection, and the chooses the best suited network architecture to train a network to recognize traffic signs in images. From these detected object, a monocular depth estimation is performed on the image using a pretrained network, which is used to calculate the depth disparity in the pixel space. In addition, several assumptions about the sizes of known objects, in order to propose a pixel-per-meter algorithm for calculating the position of the detected objects. One an image is processed and given a position, the image is either placed in an existing intersection, or a new intersection is made by exploiting the information available in open-source spatial database APIs. The information retrieved through this framework is return as a map layer in the form of a GeoJSON object
    corecore