<?xml version="1.1" encoding="utf-8"?>
<article xsi:noNamespaceSchemaLocation="http://jats.nlm.nih.gov/publishing/1.1/xsd/JATS-journalpublishing1-mathml3.xsd" dtd-version="1.1" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"><front><journal-meta><journal-id journal-id-type="publisher-id">JERA</journal-id><journal-title-group><journal-title>Journal of Electronic Research and Application</journal-title></journal-title-group><issn>2208-3502</issn><eissn>2208-3510</eissn><publisher><publisher-name>Bio-Byword Scientific Publishing Pty. Ltd.</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.26689/jera.v5i3.2320</article-id><article-categories><subj-group subj-group-type="heading"><subject>Article</subject></subj-group></article-categories><title>Research on Self-Supervised Comparative Learning for Computer Vision</title><url>https://artdesignp.com/journal/JERA/5/3/10.26689/jera.v5i3.2320</url><author>LiuYuanyuan,LiuQianqian</author><pub-date pub-type="publication-year"><year>2021</year></pub-date><volume>5</volume><issue>3</issue><history><date date-type="pub"><published-time>2021-08-17</published-time></date></history><abstract>In recent years, self-supervised learning which does not require a large number of manual labels generate supervised signals through the data itself to attain the characterization learning of samples. Self-supervised learning solves the problem of learning semantic features from unlabeled data, and realizes pre-training of models in large data sets. Its significant advantages have been extensively studied by scholars in recent years. There are usually three types of self-supervised learning: “Generative, Contrastive, and Generative-Contrastive.” The model of the comparative learning method is relatively simple, and the performance of the current downstream task is comparable to that of the supervised learning method. Therefore, we propose a conceptual analysis framework: data augmentation pipeline, architectures, pretext tasks, comparison methods, semi-supervised fine-tuning. Based on this conceptual framework, we qualitatively analyze the existing comparative self-supervised learning methods for computer vision, and then further analyze its performance at different stages, and finally summarize the research status of self-supervised comparative learning methods in other fields.</abstract><keywords/></article-meta></front><body/><back><ref-list><ref id="B1" content-type="article"><label>1</label><element-citation publication-type="journal"><p>Deng J, Dong W, Socher R, et al., 2009, Imagenet: A Large-Scale Hierarchical Image Database. In CVPR:248–255.IEEE.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B2" content-type="article"><label>2</label><element-citation publication-type="journal"><p>He K, Zhang X, et al., 2016, Deep Residual Learning for Image Recognition. In CVPR: 770–778.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B3" content-type="article"><label>3</label><element-citation publication-type="journal"><p>Huang G, et al., 2017, Weinberger. Densely Connected Convolutional Networks. 2017 IEEE CVPR: 2261–2269.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B4" content-type="article"><label>4</label><element-citation publication-type="journal"><p>Girshick R, et al., 2014, Rich Feature Hier-Archies for Accurate Object Detection and Semantic Segmentation. In CVPR: 580–587.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B5" content-type="article"><label>5</label><element-citation publication-type="journal"><p>Long J, et al., 2015, Fully Convolutional Networks for Semantic Segmentation. In CVPR: 3431–3440.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B6" content-type="article"><label>6</label><element-citation publication-type="journal"><p>Devlin J, et al., 2015, Pre-Training of Deep Bidirectional Transformers for Language Under-Standing. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, (1):4171–4186.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B7" content-type="article"><label>7</label><element-citation publication-type="journal"><p>Lan Z, et al., 2019, Albert: A Lite Bert for Self-Supervised Learning of Language Representations. arXiv preprint arXiv:1909.11942.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B8" content-type="article"><label>8</label><element-citation publication-type="journal"><p>Asai A, et al., 2019, Learning to Retrieve Reasoning Paths Over Wikipedia Graph for Question Answering. arXiv preprint arXiv:1911.10470.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B9" content-type="article"><label>9</label><element-citation publication-type="journal"><p>Hu Z, et al., 2020, Heterogeneous Graph Transformer. arXiv preprint arXiv:2003.01332.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B10" content-type="article"><label>10</label><element-citation publication-type="journal"><p>Zhang M, et al., 2018, An End-To-End Deep Learning Architecture for Graph Classification. In AAAI.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B11" content-type="article"><label>11</label><element-citation publication-type="journal"><p>Hoffmann J, et al., 2019, Infograph: Unsupervised and Semi-Supervised Graph-Level Representation Learning Via Mutual Information Maximization. arXiv preprint arXiv:1908.01000.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B12" content-type="article"><label>12</label><element-citation publication-type="journal"><p>Deng J, 2020, How Useful is Self-Supervised Pretraining for Visual Tasks? In CVPR: 7345–7354.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B13" content-type="article"><label>13</label><element-citation publication-type="journal"><p>Zoph B, et al., 2020, Rethinking Pre-Training and Self-Training. arXiv:2006.06882.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B14" content-type="article"><label>14</label><element-citation publication-type="journal"><p>Chen T, et al., 2020, Big Self-Supervised Models are Strong Semi-Supervised Learners. arXiv preprint arXiv:2006.10029.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B15" content-type="article"><label>15</label><element-citation publication-type="journal"><p>Goyal P, et al., 2017, Accurate, Large Minibatch Sgd: Training Imagenet in 1 Hour.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B16" content-type="article"><label>16</label><element-citation publication-type="journal"><p>He K, et al., 2019, Momentum Contrast for Unsupervised Visual Representation Learning.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B17" content-type="article"><label>17</label><element-citation publication-type="journal"><p>T. Chen, et al., 2020, A Simple Framework for Contrastive Learning of Visual Representations. arXiv preprint arXiv:2002.05709.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B18" content-type="article"><label>18</label><element-citation publication-type="journal"><p>Gutmann M, Hyvärinen A, 2010, Noise-Contrastive Estimation: A New Estimation Principle for Unnormalized Statistical Models. In AISTATS.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B19" content-type="article"><label>19</label><element-citation publication-type="journal"><p>Doersch C, Gupta A, et al., 2015, Unsupervised Visual Representation Learning by Context Prediction. In Proceedings of the IEEE ICCV: 1422–1430.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B20" content-type="article"><label>20</label><element-citation publication-type="journal"><p>Kim D, et al., 2018, Learning Image Representations by Completing Damaged Jigsaw Puzzles. In 2018 IEEE Winter Conference on Applications of Computer Vision (WACV): 793–802.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B21" content-type="article"><label>21</label><element-citation publication-type="journal"><p>Misra I, et al., 2019, Self-Supervised Learning of Pretext-Invariant Representations. arXiv preprint arXiv:1912.01991.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B22" content-type="article"><label>22</label><element-citation publication-type="journal"><p>Gidaris S, Singh P, et al., 2018, Unsupervised Repre-Sentation Learning by Predicting Image Rotations. arXiv preprint arXiv:1803.07728.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B23" content-type="article"><label>23</label><element-citation publication-type="journal"><p>Hjelm R, et al., 2018, Learning Deep Representations by Mutual Information Estimation and Maximization. arXiv preprint arXiv:1808.06670.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B24" content-type="article"><label>24</label><element-citation publication-type="journal"><p>Bachman P, Hjelm R, 2019, Learning Represen-Ations by Maximizing Mutual Information Across Views. In NIPS: 15509–15519.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B25" content-type="article"><label>25</label><element-citation publication-type="journal"><p>Li Y, Vinyals O, 2018, Representation Learning with Contrastive Predictive Coding. arXiv:1807.03748.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B26" content-type="article"><label>26</label><element-citation publication-type="journal"><p>Caron M, et al., 2018, Deep Clustering for Unsupervised Learning of Visual Features. In Proceedings of the ECCV (ECCV): 132–149.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B27" content-type="article"><label>27</label><element-citation publication-type="journal"><p>Zhuang C, et al., 2019, Local Aggregation for Unsupervised Learning of Visual Embeddings. In Proceedings of the IEEE ICCV: 6002–6012.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B28" content-type="article"><label>28</label><element-citation publication-type="journal"><p>Yan X, Misra I, et al., 2019, Clusterfit: Improving Generalization of Visual Representations. arXiv:1912.03330.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B29" content-type="article"><label>29</label><element-citation publication-type="journal"><p>Caron M, Misra I, et al., 2020, Unsupervised Learning of Visual Features by Contrasting Cluster Assignments. arXiv preprint arXiv:2006.09882, 2020.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B30" content-type="article"><label>30</label><element-citation publication-type="journal"><p>Goyal JP, Caron M, et al., 2021, Self-Supervised Pretraining of Visual Features in the Wild. arXiv preprint arXiv:2103.01988.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B31" content-type="article"><label>31</label><element-citation publication-type="journal"><p>Wu Z, Xiong Y, et al., 2018, Unsupervised Feature Learning Via Non-Parametric Instance Discrimination. In CVPR: 3733–3742, 2018.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B32" content-type="article"><label>32</label><element-citation publication-type="journal"><p>Tian Y, Krishnan D, et al., 2019, Contrastive Multiview Coding. arXiv preprint arXiv:1906.05849.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B33" content-type="article"><label>33</label><element-citation publication-type="journal"><p>X. Chen, H. Fan, et al., 2020, Improved Baselines with Momentum Contrastive Learning. arXiv preprint arXiv:2003.04297.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B34" content-type="article"><label>34</label><element-citation publication-type="journal"><p>Tian Y, Sun C, et al., 2005, What Makes for Good Views for Contrastive Learning. arXiv preprint arXiv:2005.10243.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B35" content-type="article"><label>35</label><element-citation publication-type="journal"><p>Grill JB, Strub F, et al., 2006, Bootstrap your Own Latent: A New Approach to Self-Supervised Learning. arXiv preprint arXiv:2006.07733.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B36" content-type="article"><label>36</label><element-citation publication-type="journal"><p>J. Mitrovic, B. McWilliams, et al., 2010, Representation Learning Via Invariant Causal Mechanisms. arXiv preprint arXiv:2010.07922.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B37" content-type="article"><label>37</label><element-citation publication-type="journal"><p>Chen X, et al., 2011, Exploring Simple Siamese Representation Learning. arXiv:2011.10566.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B38" content-type="article"><label>38</label><element-citation publication-type="journal"><p>Mikolov T, Sutskever I, et al., 2013, Distributed Representations of Words and Phrases and Their Compositionality.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B39" content-type="article"><label>39</label><element-citation publication-type="journal"><p>Arora S, Khandeparkar H, et al., 2019, A Theoretical Analysis of Contrastive Unsupervised Representation Learning.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B40" content-type="article"><label>40</label><element-citation publication-type="journal"><p>Iter D, Guu K, et al., 2020, Pretraining with Contrastive Sentence Objectives Improves Discourse Performance of Language Models.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B41" content-type="article"><label>41</label><element-citation publication-type="journal"><p>Chi Z, Dong L, Wei F, et al., 2020, Infoxlm: An Information-Theoretic Framework for Cross-Lingual Language Model Pre-Training.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B42" content-type="article"><label>42</label><element-citation publication-type="journal"><p>Fang H, Wang S, Zhou M, et al., 2020, Cert: Contrastive Self-Supervised Learning for Language Understanding.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B43" content-type="article"><label>43</label><element-citation publication-type="journal"><p>Giorgi J, Nitski O, Bader G, et al., 2020, Declutr: Deep Contrastive Learning for Unsupervised Textual Representations.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B44" content-type="article"><label>44</label><element-citation publication-type="journal"><p>Ma, Shuang, et al., 2021, “Active Contrastive Learning of Audio-Visual Video Representations.” ICLR 2021: The Ninth International Conference on Learning Representations.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B45" content-type="article"><label>45</label><element-citation publication-type="journal"><p>Radford, Alec, et al., 2021, “Learning Transferable Visual Models from Natural Language Supervision.” ArXiv Preprint ArXiv:2103.00020.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B46" content-type="article"><label>46</label><element-citation publication-type="journal"><p>Jia, Chao, et al., 2021, “Scaling Up Visual and Vision-Language Representation Learning with Noisy Text Supervision.” ArXiv Preprint ArXiv:2102.05918.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B47" content-type="article"><label>47</label><element-citation publication-type="journal"><p>Huo Y, et al., 2021, “WenLan: Bridging Vision and Language by Large-Scale Multi-Modal Pre-Training.” ArXiv Preprint ArXiv:2103.06561.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B48" content-type="article"><label>48</label><element-citation publication-type="journal"><p>Wei C, Xie L, Ren X, et al., 2019, Iterative Reorganization with Weak Spatial Constraints: Solving Arbitrary Jigsaw Puzzles for Unsupervised Representation Learning. In CVPR: 1910–1919.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B49" content-type="article"><label>49</label><element-citation publication-type="journal"><p>Li, W. Hung J, Huang S, et al., 2016, Unsupervised Visual Representation Learning by Graph-Based Consistent Constraints. In ECCV: 678–694. Springer.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B50" content-type="article"><label>50</label><element-citation publication-type="journal"><p>Noroozi M, Vinjimoor A, Favaro P, et al., 2018, Boosting Self-Supervised Learning Via Knowledge Transfer. In CVPR: 9359–9367.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B51" content-type="article"><label>51</label><element-citation publication-type="journal"><p>Yang J, Parikh D, Batra D, 2016, Joint Unsupervised Learning of Deep Representations and Image Clusters. In CVPR: 5147–5156.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B52" content-type="article"><label>52</label><element-citation publication-type="journal"><p>Olivier J, Hénaff, Razavi A, Doersch C, et al., 2019, Data-Efficient Image Recognition with Contrastive Predictive Coding. arXiv preprint arXiv:1905.09272.</p><pub-id pub-id-type="doi"/></element-citation></ref></ref-list></back></article>
