İki boyutlu tekil görüntüden çekişmeli üretici ağlar kullanılarak üç boyutlu nesne üretimi
Tarih
Yazarlar
Dergi Başlığı
Dergi ISSN
Cilt Başlığı
Yayıncı
Erişim Hakkı
Özet
Bu çalışmada, tek iki boyutlu görüntüden üç boyutlu nesne üretimi için Varyasyonel Otomatik Kodlayıcı (Variational Autoencoder – VAE) ve Çekişmeli Üretici Ağ (Generative Adversarial Network – GAN) temelli 3D-VAE-GAN mimarisi kullanılmıştır. Temsil için Derin Sinir Ağları (Deep Neural Networks – DNN) ile uyumlu voksel (volumetric pixel) gösterimi seçilmiştir. Üretim başarımını artırmak için yeniden yapılandırma kaybı (reconstruction loss) olarak Ortalama Karesel Hata (Mean Squared Error – MSE), İkili Çapraz Entropi (Binary Cross-Entropy – BCE), Odak Kaybı (Focal Loss – FL) türevi olan Modülasyon Faktörü Kaybı (Modulating Factor Loss – MFL), Dice Kaybı (Dice Loss – DLS) ve Kesişim Üzeri Birleşim (Intersection over Union – IoU) Kaybı kıyaslanmış; yüzey doğruluğu için özgün bir Uyarlamalı Ağırlıklandırılmış IoU-Odak Kaybı (Adaptive Weighted IoU-Focal Loss – AWIF) önerilmiştir. Literatürdeki Sıkıştırma ve Uyarma (Squeeze-and-Excitation – SE) ile Evrişimsel Blok Dikkat Modülü (Convolutional Block Attention Module – CBAM) dikkat (attention) mekanizmalarına ek olarak frekans düzleminde çalışan özgün bir Karmaşık Faz Kaydırma Dikkati (Complex Phase-Shifting Spatial Attention – CPSA) geliştirilmiştir. GAN sorunları olan mod çökmesi (mode collapse), kaybolan gradyan (vanishing gradient) ve kararsız eğitimi aşmak için Wasserstein Çekişmeli Üretici Ağ (Wasserstein Generative Adversarial Network – WGAN) uygulanmıştır. Kırmızı-Yeşil-Mavi (Red-Green-Blue – RGB) kanallarına derinlik haritaları (depth maps) eklenmiştir. Mimari 2D mixup veri artırma (data augmentation), kodlayıcı (encoder) olarak Derin Artık Ağlar (Deep Residual Networks – ResNet), topluluk (ensemble) tahmini, Spektral Normalizasyon (Spectral Normalization – SN) ve Lipschitz kısıtına (Lipschitz constraint) uyum için Gradyan Cezalandırması (Gradient Penalty – GP) ile güçlendirilerek Spektral Wasserstein Dikkat Üretici Topluluk-3D (Spectral Wasserstein Attention Generative Ensemble 3D – SWAGE-3D) yapısı oluşturulmuştur. ShapeNet veri setindeki 13 sınıfta IoU, Chamfer Uzaklığı (Chamfer Distance – CD) ve F-Skoru (F-Score) başarım metrikleriyle yapılan analizler, bu geliştirmelerin nicel (quantitative) ve nitel (qualitative) başarıyı belirgin şekilde artırdığını kanıtlamaktadır.
In this study, a 3D-VAE-GAN architecture based on Variational Autoencoder (VAE) and Generative Adversarial Network (GAN) was utilized for 3D object generation from a single two-dimensional image. A voxel (volumetric pixel) representation compatible with Deep Neural Networks (DNN) was selected. To improve generation performance, Mean Squared Error (MSE), Binary Cross-Entropy (BCE), Modulating Factor Loss (MFL) which is a derivative of Focal Loss (FL), Dice Loss (DLS), and Intersection over Union (IoU) Loss were compared as reconstruction losses; and a novel Adaptive Weighted IoU-Focal Loss (AWIF) was proposed for surface accuracy. In addition to the Squeeze-and-Excitation (SE) and Convolutional Block Attention Module (CBAM) attention mechanisms in the literature, a novel Complex Phase-Shifting Spatial Attention (CPSA) operating in the frequency domain was developed. To overcome GAN issues such as mode collapse, vanishing gradient, and unstable training, the Wasserstein Generative Adversarial Network (WGAN) was implemented. Depth maps were added to the Red-Green-Blue (RGB) channels. The architecture was fortified with 2D mixup data augmentation, Deep Residual Networks (ResNet) as the encoder, ensemble prediction, Spectral Normalization (SN), and Gradient Penalty (GP) to comply with the Lipschitz constraint, thereby establishing the Spectral Wasserstein Attention Generative Ensemble 3D (SWAGE-3D) structure. Analyses conducted on 13 classes from the ShapeNet dataset using IoU, Chamfer Distance (CD), and F-Score performance metrics prove that these enhancements significantly improve both quantitative and qualitative performance.












