Region-based Fully Convolutional Networks (R-FCN) sind ein Typ von Objekterkennungsmodellen, die auf der Verwendung von vollstÀndig konvolutionellen Netzwerken basieren. Im Gegensatz zu anderen Region-basierten Objekterkennungsmodellen wie Fast/Faster R-CNN, die einen kostspieligen per-Region-Subnetzwerk hunderte Male anwenden, ist R-FCN vollstÀndig konvolutionell mit fast allen Berechnungen, die auf dem gesamten Bild geteilt werden.
Die Motivation hinter R-FCN ist die Verbesserung der Geschwindigkeit und Genauigkeit von Objekterkennungsmodellen. Fast R-CNN und Faster R-CNN sind zwei populĂ€re Region-basierte Objekterkennungsmodelle, die in zwei Stufen arbeiten: Region-VorschlĂ€ge generieren und Klassifizierung und Lokalisierung (Boundary-Boxen) vorhersagen. R-FCN verbessert die Geschwindigkeit, indem es die Menge an Arbeit reduziert, die fĂŒr jeden Region-Vorschlag erforderlich ist.
R-FCN verwendet Position-sensitve Score Maps, um die Dilemma zwischen Translation-Invarianz in Bildklassifizierung und Translation-Varianz in Objekterkennung zu lösen. Diese Score Maps sind unabhĂ€ngig von den Region-VorschlĂ€gen und können auĂerhalb jeder Region berechnet werden. Dadurch kann die Berechnung fĂŒr jeden Region-Vorschlag vereinfacht werden.
Die Architektur von R-FCN besteht aus drei Hauptkomponenten:
R-FCN bietet mehrere Vorteile gegenĂŒber anderen Region-basierten Objekterkennungsmodellen:
R-FCN hat eine Vielzahl von Anwendungen in der Objekterkennung, einschlieĂlich:
R-FCN wurde in verschiedenen Frameworks implementiert, einschlieĂlich Caffe und MXNet. Die Implementierung von R-FCN in Caffe ist auf GitHub verfĂŒgbar.
Wenn Sie R-FCN in Ihrer Forschung verwenden, bitte zitieren Sie den Originalartikel:
@article{dai16rfcn, Author = {Jifeng Dai, Yi Li, Kaiming He, Jian Sun}, Title = {{R-FCN}: Object Detection via Region-based Fully Convolutional Networks}, Journal = {arXiv preprint arXiv:1605.06409}, Year = {2016} }
* KI-Zusammenfassungen können Fehler enthalten. Alle Angaben ohne GewÀhr.