<?xml version="1.0" encoding="UTF-8"?><!DOCTYPE article  PUBLIC "-//NLM//DTD Journal Publishing DTD v3.0 20080202//EN" "http://dtd.nlm.nih.gov/publishing/3.0/journalpublishing3.dtd"><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" dtd-version="3.0" xml:lang="en" article-type="research article"><front><journal-meta><journal-id journal-id-type="publisher-id">JSIP</journal-id><journal-title-group><journal-title>Journal of Signal and Information Processing</journal-title></journal-title-group><issn pub-type="epub">2159-4465</issn><publisher><publisher-name>Scientific Research Publishing</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.4236/jsip.2019.103006</article-id><article-id pub-id-type="publisher-id">JSIP-94197</article-id><article-categories><subj-group subj-group-type="heading"><subject>Articles</subject></subj-group><subj-group subj-group-type="Discipline-v2"><subject>Computer Science&amp;Communications</subject></subj-group></article-categories><title-group><article-title>
 
 
  Target Tracking and Classification Using Compressive Measurements of MWIR and LWIR Coded Aperture Cameras
 
</article-title></title-group><contrib-group><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Chiman</surname><given-names>Kwan</given-names></name><xref ref-type="aff" rid="aff1"><sup>1</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Bryan</surname><given-names>Chou</given-names></name><xref ref-type="aff" rid="aff1"><sup>1</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Jonathan</surname><given-names>Yang</given-names></name><xref ref-type="aff" rid="aff2"><sup>2</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Akshay</surname><given-names>Rangamani</given-names></name><xref ref-type="aff" rid="aff3"><sup>3</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Trac</surname><given-names>Tran</given-names></name><xref ref-type="aff" rid="aff3"><sup>3</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Jack</surname><given-names>Zhang</given-names></name><xref ref-type="aff" rid="aff4"><sup>4</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Ralph</surname><given-names>Etienne-Cummings</given-names></name><xref ref-type="aff" rid="aff3"><sup>3</sup></xref></contrib></contrib-group><aff id="aff4"><addr-line>Department of Electrical Engineering, Massachusetts Institute of Technology, Cambridge, Massachusetts, USA</addr-line></aff><aff id="aff3"><addr-line>Department of Electrical and Computer Engineering, the Johns Hopkins University, Baltimore, USA</addr-line></aff><aff id="aff2"><addr-line>Google, Inc., Mountain View, California, USA</addr-line></aff><aff id="aff1"><addr-line>Applied Research LLC, Rockville, Maryland, USA</addr-line></aff><pub-date pub-type="epub"><day>08</day><month>08</month><year>2019</year></pub-date><volume>10</volume><issue>03</issue><fpage>73</fpage><lpage>95</lpage><history><date date-type="received"><day>4,</day>	<month>July</month>	<year>2019</year></date><date date-type="rev-recd"><day>5,</day>	<month>August</month>	<year>2019</year>	</date><date date-type="accepted"><day>8,</day>	<month>August</month>	<year>2019</year></date></history><permissions><copyright-statement>&#169; Copyright  2014 by authors and Scientific Research Publishing Inc. </copyright-statement><copyright-year>2014</copyright-year><license><license-p>This work is licensed under the Creative Commons Attribution International License (CC BY). http://creativecommons.org/licenses/by/4.0/</license-p></license></permissions><abstract><p>
 
 
  
    Pixel-wise Code Exposure (PCE) camera is one type of compressive sensing camera that has low power consumption and high compression ratio. Moreover, a PCE camera can control individual pixel exposure time that can enable high dynamic range. Conventional approaches of using PCE camera involve a time consuming and lossy process to reconstruct the original frames and then use those frames for target tracking and classification. In this paper, we present a deep learning approach that directly performs target tracking and classification in the compressive measurement domain without any frame reconstruction. Our approach has two parts: tracking and classification. The tracking has been done using YOLO (You Only Look Once) and the classification is achieved using Residual Network (ResNet). Extensive experiments using mid-wave infrared (MWIR) and long-wave infrared (LWIR) videos demonstrated the efficacy of our proposed approach. 
  
 
</p></abstract><kwd-group><kwd>Target Tracking</kwd><kwd> Classification</kwd><kwd> Compressive Sensing</kwd><kwd> MWIR</kwd><kwd> LWIR</kwd><kwd> YOLO</kwd><kwd> ResNet</kwd><kwd> Infrared Videos</kwd></kwd-group></article-meta></front><body><sec id="s1"><title>1. Introduction</title><p>There are many applications such as traffic monitoring, surveillance, and security monitoring that use optical and infrared videos [<xref ref-type="bibr" rid="scirp.94197-ref1">1</xref>] - [<xref ref-type="bibr" rid="scirp.94197-ref5">5</xref>]. Object features in optical and infrared videos can be clearly seen as compared to radar-based trackers [<xref ref-type="bibr" rid="scirp.94197-ref6">6</xref>] [<xref ref-type="bibr" rid="scirp.94197-ref7">7</xref>].</p><p>Compressive measurements [<xref ref-type="bibr" rid="scirp.94197-ref8">8</xref>] [<xref ref-type="bibr" rid="scirp.94197-ref9">9</xref>] [<xref ref-type="bibr" rid="scirp.94197-ref10">10</xref>] [<xref ref-type="bibr" rid="scirp.94197-ref11">11</xref>] can save data storage and transmission costs. They are normally collected by multiplying the original vectorized image with a Gaussian random matrix. Each measurement contains a scalar value and the measurement is repeated M times where M is much fewer than N (the number of pixels). To track a target using compressive measurements, it is normally done by reconstructing the image scene and then conventional trackers are then applied.</p><p>Tracking and classification of targets in compressive measurement domain is difficult because target location, size, and shape information are destroyed by the Gaussian measurement matrix. Conventional approaches do not work well without image reconstruction.</p><p>Recently, a new compressive sensing device known as Pixel-wise Code Exposure (PCE) camera was proposed [<xref ref-type="bibr" rid="scirp.94197-ref12">12</xref>]. A hardware prototype was developed and performance was proven. In [<xref ref-type="bibr" rid="scirp.94197-ref12">12</xref>] , the original frames were reconstructed using L<sub>0</sub> [<xref ref-type="bibr" rid="scirp.94197-ref13">13</xref>] [<xref ref-type="bibr" rid="scirp.94197-ref14">14</xref>] [<xref ref-type="bibr" rid="scirp.94197-ref15">15</xref>] or L<sub>1</sub> [<xref ref-type="bibr" rid="scirp.94197-ref16">16</xref>] sparsity-based algorithms. One problem with the reconstruction-based approach is that it is extremely time consuming to reconstruct the original frames and hence this may prohibit real-time applications. Moreover, information may be lost in the reconstruction process [<xref ref-type="bibr" rid="scirp.94197-ref17">17</xref>]. For target tracking and classification applications, it will be ideal if one can carry out target tracking and classification directly in the compressive measurement domain. Although there are some tracking papers [<xref ref-type="bibr" rid="scirp.94197-ref18">18</xref>] in the literature that appear to be using compressive measurements, they are actually still using the original video frames for tracking.</p><p>In our earlier paper [<xref ref-type="bibr" rid="scirp.94197-ref19">19</xref>] , we presented a deep learning approach that directly incorporates the PCE measurements. In that work, we focused only on shortwave infrared (SWIR) videos. It is well-known that there are several key differences between SWIR, MWIR, and LWIR videos. First, SWIR cameras require external illuminations whereas MWIR and LWIR do not need external illumination sources because MWIR and LWIR are sensitive to heat radiation from objects. Second, the image characteristics are very different. Target shadows can affect the target detection performance in SWIR videos. However, there are no shadows in MWIR and LWIR videos. Third, atmospheric obscurants cause much less scattering in the MWIR and LWIR bands than in the SWIR band. Consequently, MWIR and LWIR cameras are tolerant of smoke, dust and fog.</p><p>Because of the different characteristics in SWIR, MWIR, and LWIR videos, it is necessary to study the performance of the previously proposed deep learning approach [<xref ref-type="bibr" rid="scirp.94197-ref19">19</xref>] to MWIR and LWIR videos. In this paper, we propose a target tracking and classification approach in compressive measurement domain for MWIR and LWIR images. First, a YOLO detector [<xref ref-type="bibr" rid="scirp.94197-ref20">20</xref>] is used for target tracking. This is called tracking by detection. The training of YOLO tracker is very simple, which requires image frames with known target locations. Although YOLO can also perform classification, the performance is not good as we have a very limited number of video frames for training. As a result, in the second step of target classification, we decided to use ResNet [<xref ref-type="bibr" rid="scirp.94197-ref21">21</xref>] for classification. We chose ResNet because it allows us to perform customized training by augmenting the data from the limited video frames. Our proposed approach was demonstrated using MWIR and LWIR videos with about 3000 frames in each video. The tracking and classification results are reasonable. This is a big improvement over conventional trackers [<xref ref-type="bibr" rid="scirp.94197-ref22">22</xref>] [<xref ref-type="bibr" rid="scirp.94197-ref23">23</xref>] , which do not work well in the compressive measurement domain.</p><p>This paper is organized as follows. In Section 2, we describe some background materials, including the PCE camera, YOLO, ResNet, video data, and performance metrics. In Section 3, we summarize the tracking and classification results using MWIR and LWIR videos. Finally, we conclude our paper with some remarks for future research.</p></sec><sec id="s2"><title>2. Background and Technical Approach</title><sec id="s2_1"><title>2.1. PCE Imaging and Coded Aperture</title><p>In this paper, we employ a sensing scheme based on PCE or also known as Coded Aperture (CA) video frames as described in [<xref ref-type="bibr" rid="scirp.94197-ref12">12</xref>]. <xref ref-type="fig" rid="fig1">Figure 1</xref> illustrates the differences between a conventional video sensing scheme and PCE, where random spatial pixel activation is combined with fixed temporal exposure duration. First, conventional cameras capture frames at certain frame rates such as 30 frames per second. In contrast, PCE camera captures a compressed frame called motion coded image over a fixed period of time (Tv). For example, a user can compress 30 conventional frames into a single motion coded frame. This will yield significant data compression ratio. Second, the PCE camera allows a user to use different exposure times for different pixel locations. For low lighting regions, more exposure times can be used and for strong light areas, short exposure can be exerted. This will allow high dynamic range. Moreover, power can also be saved via low sampling rate in the data acquisition process. As shown in <xref ref-type="fig" rid="fig1">Figure 1</xref>, one conventional approach to using the motion coded images is to apply sparse reconstruction to reconstruct the original frames and this process may be very time consuming.</p><p>Suppose the video scene is contained in a data cube X ∈ R M &#215; N &#215; T where M &#215; N is the image size and T is the number of frames. A sensing data cube is defined by S ∈ R M &#215; N &#215; T which contains the exposure times for pixel located at (m, n, t). The value of S ( m , n , t ) is 1 for frames t ∈ [ t start , t end ] and 0 otherwise. [t<sub>start</sub>, t<sub>end</sub>] denotes the start and end frame numbers for a particular pixel.</p><p>The measured coded aperture image Y ∈ R M &#215; N is obtained by</p><p>Y ( m , n ) = ∑ t = 1 T S ( m , n , t ) ⋅ X ( m , n , t ) (1)</p><p>The original video scene X ∈ R M &#215; N &#215; T can be reconstructed via sparsity methods (L<sub>1</sub> or L<sub>0</sub>). Details can be found in [<xref ref-type="bibr" rid="scirp.94197-ref12">12</xref>].</p><p>Instead of doing sparse reconstruction on PCE images or frames, our scheme directly acts on the PCE or Coded Aperture Images, which contain raw sensing measurements without the need for any reconstruction effort. Utilizing raw measurements has several challenges. First, moving targets may be smeared if the exposure times are long. Second, there are also missing pixels in the raw measurements because not all pixels are activated during the data collection process. Third, there are much fewer frames in the raw video because many original frames are compressed into a single coded frame. Consequently, training data may be scarce.</p><p>In this study, we have focused our effort into simulating the measurements that should be produced by the PCE-based compressive sensing (CS) sensor. We then proceed to show that detecting, tracking, and even classifying moving objects of interest in the scene is feasible. We carried out multiple experiments with three diverse sensing models: PCE/CA Full, PCE/CA 50%, and PCE/CA 25%. PCE full refers to the compression of 30 frames to 1 with no missing pixels. PCE 50 is the case where we compress 30 frames to 1 and at the same time, only 50% of pixels are activated for a length of 4/30 seconds. PCE 25 is similar to PCE 50 except that only 25% of the pixels are activated for 4/30 seconds.</p><p><xref ref-type="table" rid="table1">Table 1</xref> below summarizes the comparison between the three sensing models. Details can be found in [<xref ref-type="bibr" rid="scirp.94197-ref19">19</xref>].</p></sec><sec id="s2_2"><title>2.2. YOLO</title><p>Strictly speaking, YOLO is a detector rather than a tracker. Here, tracking is done via detection. That is, we apply YOLO to detect multiple targets and the target locations are extracted in every frame. Collecting the location information from the various frames will then create target trajectories.</p><table-wrap id="table1" ><label><xref ref-type="table" rid="table1">Table 1</xref></label><caption><title> Comparison in data compression ratio and power saving ratio between three sensing models</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >PCE Full/CA Full</th><th align="center" valign="middle" >PCE 50%/CA 50%</th><th align="center" valign="middle" >PCE 25%/CA 25%</th></tr></thead><tr><td align="center" valign="middle" >Data Saving Ratio</td><td align="center" valign="middle" >30:1</td><td align="center" valign="middle" >60:1</td><td align="center" valign="middle" >120:1</td></tr><tr><td align="center" valign="middle" >Power Saving Ratio</td><td align="center" valign="middle" >1:1</td><td align="center" valign="middle" >15:1</td><td align="center" valign="middle" >30:1</td></tr></tbody></table></table-wrap><p>YOLO tracker [<xref ref-type="bibr" rid="scirp.94197-ref20">20</xref>] is fast and has similar performance as Faster R-CNN [<xref ref-type="bibr" rid="scirp.94197-ref24">24</xref>]. We picked YOLO because it is easy to install and is also compatible with our hardware, which seems to have a hard time to install and run Faster R-CNN. The training of YOLO is quite simple. Images with ground truth target locations are needed.</p><p>YOLO has 24 convolutional layers followed by 2 fully connected layers. Details can be found in [<xref ref-type="bibr" rid="scirp.94197-ref20">20</xref>]. The input images are resized to 448 &#215; 448. It has some built-in capability to deal with different target sizes and illuminations. However, it is found that histogram matching is essential in order to make the tracker more robust to illumination changes.</p><p>YOLO also comes with a classification module. However, based on our evaluations, the classification accuracy using YOLO is not as good as ResNet in Section 3. This is perhaps due to a lack of training data.</p></sec><sec id="s2_3"><title>2.3. ResNet Classifier</title><p>The ResNet-18 model is an 18-layer convolutional neural network (CNN) that has the advantage of avoiding performance saturation and/or degradation when training deeper layers, which is a common problem among other CNN architectures. The ResNet-18 model avoids the performance saturation by implementing an identity shortcut connection, which skips one or more layers and learns the residual mapping of the layer rather than the original mapping.</p><p>Training of ResNet requires target patches. The targets are cropped from training videos. Mirror images are then created. We then perform data augmentation using scaling (larger and smaller), rotation (every 45 degrees), and illumination (brighter and dimmer) to create more training data. For each cropped target, we are able to create a data set with 64 more images.</p></sec><sec id="s2_4"><title>2.4. Data</title><p>We have mid-wave infrared (MWIR) and long-wave infrared (LWIR) videos from our sponsor. There are two videos from each imager: Video 4 and Video 5. Vehicles in Video 4 start from a parking lot and then travel to a remote location. Video 5 is just the opposite. Each frame contains up to three vehicles (Ram, Silverado, and Frontier), which are shown below in <xref ref-type="fig" rid="fig2">Figure 2</xref>.</p><p>It is challenging for target tracking and classification using the above videos for several reasons. First, the target orientation changes from the top view to side views. Second, the target size varies a lot in different frames. Third, the illumination is also different. Fourth, the vehicles look very similar to one another, as can be seen in <xref ref-type="fig" rid="fig2">Figure 2</xref>.</p><p>Here, we also briefly mention the image characteristics of SWIR, MWIR, and LWIR. From <xref ref-type="fig" rid="fig3">Figure 3</xref> [<xref ref-type="bibr" rid="scirp.94197-ref25">25</xref>] , one can see the bands are different. SWIR lies in the range of 0.9 to 1.7 microns; MWIR is in the range of 3 to 5 microns; LWIR is within the range of 8 to 14 microns. Because of those different wavelength ranges, the image characteristics are very different, as can be seen in <xref ref-type="fig" rid="fig4">Figure 4</xref> and <xref ref-type="fig" rid="fig5">Figure 5</xref>. The daytime and nighttime behaviors are also different.</p></sec><sec id="s2_5"><title>2.5. Performance Metrics</title><p>We used the following metrics for evaluating the YOLO tracker performance:</p><p>&#183; Center Location Error (CLE): It is the error between the center of the bounding box and the ground-truth bounding box.</p><p>&#183; Distance Precision (DP): It is the percentage of frames where the centroids of detected bounding boxes are within 20 pixels of the centroid of ground-truth bounding boxes.</p><p>&#183; EinGT: It is the percentage of the frames where the centroids of the detected bounding boxes are inside the ground-truth bounding boxes.</p><p>&#183; Number of frames with detection: This is the total number of frames that have detection.</p><p>For classification, we used confusion matrix and classification accuracy as performance metrics.</p></sec></sec><sec id="s3"><title>3. Tracking and Classification Results Using MWIR Videos</title><p>In a companion paper [<xref ref-type="bibr" rid="scirp.94197-ref19">19</xref>] , we have applied the YOLO + ResNet framework to some SWIR videos directly in compressive measurement domain. Since image characteristics are very different for SWIR, MWIR, LWIR, it is necessary to carry out a new study to investigate the deep learning-based framework in [<xref ref-type="bibr" rid="scirp.94197-ref19">19</xref>]. Here, we focus on the case of tracking and classification using a combination of YOLO and ResNet for MWIR and LWIR videos. There are three cases.</p><p>We have two MWIR videos. Each one has close to 3000 frames. One video (Video 4) starts with vehicles (Ram, Frontier, and Silverado) leaving a parking lot and moves on to a remote location. Another video (Video 5) is just the opposite. In addition to the aforementioned challenges, the two videos are difficult for tracking and classification because the cameras also move in order to follow the targets.</p><sec id="s3_1"><title>3.1. Tracking Results</title><p>Conventional tracker results</p><p>We first present some tracking results using a conventional tracker known as STAPLE [<xref ref-type="bibr" rid="scirp.94197-ref22">22</xref>]. STAPLE requires the target location to be known in the first frame. After that, STAPLE learns the target model online and tracks the target. However, even in PCE full cases as shown in <xref ref-type="fig" rid="fig6">Figure 6</xref> for MWIR videos and in <xref ref-type="fig" rid="fig7">Figure 7</xref> for LWIR videos. STAPLE was not able to track any targets in subsequent frames. This shows the difficulty of target tracking using PCE cameras.</p><p>MWIR: Train using Video 4 and Test using Video 5</p><p>We used YOLO tracker here. Video 4 was used for training and Video 5 for testing. Four performance metrics were used in the studies. Tables 2-4 show the tracking results for PCE full, PCE 50, and PCE 25, respectively. In <xref ref-type="table" rid="table2">Table 2</xref> (PCE full case), one can see that the percentages of correct detection are very high. The CLE is around 5 pixels and the DP and EinGT values are all close to 100%. In <xref ref-type="table" rid="table3">Table 3</xref> (PCE 50 case), we observe that the percentages of correct detection start to drop. The CLE values become higher as compared to PCE full. The DP and EinGT values are still good. For the PCE 25 case (<xref ref-type="table" rid="table4">Table 4</xref>), the percentages of frames with detection are even lower as compared to the other two cases. The CLE values are getting bigger. The general trend is that when the compression ratio increases, the performance drops accordingly. This can be corroborated in the snapshots shown in Figures 8-10 where more incorrect labels can be seen in the high compression cases. It should be noted that labels came from the YOLO tracker, which has inferior performance than ResNet. We will see more classification results in the later sections.</p><table-wrap id="table2" ><label><xref ref-type="table" rid="table2">Table 2</xref></label><caption><title> Tracking metrics for PCE full. Train using Video 4 and test using Video 5</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >5.17</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >85/89</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >4.23</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >85/89</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >4.58</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >70/89</td></tr></tbody></table></table-wrap><table-wrap id="table3" ><label><xref ref-type="table" rid="table3">Table 3</xref></label><caption><title> Tracking metrics for PCE 50. Train using Video 4 and test using Video 5</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >7.58</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.99</td><td align="center" valign="middle" >76/89</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >6.26</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >79/89</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >6.75</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" >62/89</td></tr></tbody></table></table-wrap><table-wrap id="table4" ><label><xref ref-type="table" rid="table4">Table 4</xref></label><caption><title> Tracking metrics for PCE 25. Train using Video 4 and test using Video 5</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >8.89</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >58/89</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >7.27</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >63/89</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >8.31</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" >40/89</td></tr></tbody></table></table-wrap><p>MWIR: Train using Video 5 and Test using Video 4</p><p>This is the reverse case where Video 5 was used for training and Video 4 for testing. Tables 5-7 show the tracking results for PCE full, PCE 50, and PCE 25, respectively. The trend is that when the compression ratio increases, the performance drops accordingly. This can be confirmed in the snapshots shown in Figures 11-13 where we can see that some targets do not have bounding boxes around them in the high compression cases. We also see that more incorrect labels in high compression cases.</p></sec><sec id="s3_2"><title>3.2. Classification Results</title><p>Here, we applied two classifiers: YOLO and ResNet. It should be noted that classification is performed only when there are good detection results from the YOLO tracker. For some frames in the PCE 50 and PCE 25, there may not be positive detection results and for those frames, we do not generate any classification results.</p><p>MWIR: Training Using Video 4 and Testing Using Video 5</p><p>Here, Video 4 was used for training and Video 5 for testing. Tables 8-10 show the classification results using YOLO and ResNet for PCE full, PCE 50, and PCE 25, respectively. In each table, the left side shows the confusion matrix and the last column shows the classification accuracy. In all cases, the first observation is that the ResNet performance is better than that of YOLO. For instance, the averaged classification accuracy in ResNet is 0.5 and the averaged classification accuracy for YOLO is only 0.31 in the PCE full case. The second observation is that the classification performance deteriorates with high missing rates. Due to aggressive compression (&gt;30:1), the ResNet classification rates are also low in the PCE 25 case. Third, we also notice that Frontier has higher classification accuracy than Ram and Silverado. This is probably because RAM and Silverado may have similar appearance, as can be seen from the confusion matrices in those tables.</p><table-wrap id="table5" ><label><xref ref-type="table" rid="table5">Table 5</xref></label><caption><title> Tracking metrics for PCE full. Train using Video 5 and test using Video 4</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >6.31</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.97</td><td align="center" valign="middle" >93/110</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >6.53</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.97</td><td align="center" valign="middle" >107/110</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >6.19</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >66/110</td></tr></tbody></table></table-wrap><table-wrap id="table6" ><label><xref ref-type="table" rid="table6">Table 6</xref></label><caption><title> Tracking metrics for PCE 50. Train using Video 5 and test using Video 4</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >7.72</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.97</td><td align="center" valign="middle" >86/110</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >8.08</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.98</td><td align="center" valign="middle" >91/110</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >8.5</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >50/110</td></tr></tbody></table></table-wrap><table-wrap id="table7" ><label><xref ref-type="table" rid="table7">Table 7</xref></label><caption><title> Tracking metrics for PCE 25. Train using Video 5 and test using Video 4</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >9.27</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.98</td><td align="center" valign="middle" >64/110</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >8.43</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" >58/110</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >7.75</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >24/110</td></tr></tbody></table></table-wrap><table-wrap-group id="8"><label><xref ref-type="table" rid="table8">Table 8</xref></label><caption><title> Classification results for PCE full case. Video 4 for training and Video 5 for testing. (a)YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="8_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >32</td><td align="center" valign="middle" >41</td><td align="center" valign="middle" >0.1412</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >15</td><td align="center" valign="middle" >65</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0.7927</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >63</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.0154</td></tr></tbody></table></table-wrap><table-wrap id="8_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >51</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >31</td><td align="center" valign="middle" >0.6000</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >30</td><td align="center" valign="middle" >45</td><td align="center" valign="middle" >10</td><td align="center" valign="middle" >0.5294</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >41</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >28</td><td align="center" valign="middle" >0.4000</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="9"><label><xref ref-type="table" rid="table9">Table 9</xref></label><caption><title> Classification results for PCE 50 case. Video 4 for training and Video 5 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="9_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >41</td><td align="center" valign="middle" >22</td><td align="center" valign="middle" >0.1600</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >22</td><td align="center" valign="middle" >52</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.6933</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >57</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr></tbody></table></table-wrap><table-wrap id="9_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >36</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >28</td><td align="center" valign="middle" >0.4737</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >34</td><td align="center" valign="middle" >42</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >0.5316</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >38</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >20</td><td align="center" valign="middle" >0.3226</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="10"><label><xref ref-type="table" rid="table1">Table 1</xref>0</label><caption><title> Classification results for PCE 25 case. Video 4 for training and Video 5 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="10_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >6</td><td align="center" valign="middle" >35</td><td align="center" valign="middle" >16</td><td align="center" valign="middle" >0.1053</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >24</td><td align="center" valign="middle" >35</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0.5738</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >37</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr></tbody></table></table-wrap><table-wrap id="10_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >22</td><td align="center" valign="middle" >30</td><td align="center" valign="middle" >6</td><td align="center" valign="middle" >0.3793</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >16</td><td align="center" valign="middle" >46</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.7302</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >15</td><td align="center" valign="middle" >10</td><td align="center" valign="middle" >15</td><td align="center" valign="middle" >0.3750</td></tr></tbody></table></table-wrap></table-wrap-group><p>MWIR: Training Using Video 5 and Testing Using Video 4</p><p>Here, Video 5 was used for training and Video 4 for testing. The observations in Tables 11-13 are similar to the earlier case. That is, ResNet is better than YOLO and classification performance drops with high compression rates.</p></sec></sec><sec id="s4"><title>4. Tracking and Classification Results Using LWIR Videos</title><p>Here, we summarize the studies for LWIR videos.</p><sec id="s4_1"><title>4.1. Tracking Results</title><p>LWIR: Train using Video 4 and Test using Video 5</p><p>From <xref ref-type="table" rid="table1">Table 1</xref>4 (PCE full) case, the CLE, DP, and EinGT metrics all look normal. The numbers of frames with detection are lower than those of MWIR. Frontier has higher detections than Ram and Silverado. For PCE 50 (<xref ref-type="table" rid="table1">Table 1</xref>5) and PCE 25 cases (<xref ref-type="table" rid="table1">Table 1</xref>6), we observe that the YOLO tracker has more missed detections when the compression ratio increases. DP and EinGT scores are all high. CLE scores increase as compression increases. Moreover, from Figures 14-16, we can see that there are some missed bounding boxes as well as incorrect labels around the vehicles.</p><table-wrap-group id="11"><label><xref ref-type="table" rid="table1">Table 1</xref>1</label><caption><title> Classification results for PCE Full case. Video 5 for training and Video 4 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="11_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >17</td><td align="center" valign="middle" >38</td><td align="center" valign="middle" >38</td><td align="center" valign="middle" >0.1828</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >44</td><td align="center" valign="middle" >61</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.5810</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >51</td><td align="center" valign="middle" >13</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.0154</td></tr></tbody></table></table-wrap><table-wrap id="11_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >31</td><td align="center" valign="middle" >30</td><td align="center" valign="middle" >32</td><td align="center" valign="middle" >0.3333</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >6</td><td align="center" valign="middle" >94</td><td align="center" valign="middle" >7</td><td align="center" valign="middle" >0.8785</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >16</td><td align="center" valign="middle" >23</td><td align="center" valign="middle" >27</td><td align="center" valign="middle" >0.4091</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="12"><label><xref ref-type="table" rid="table1">Table 1</xref>2</label><caption><title> Classification results for PCE 50 case. Video 5 for training and Video 4 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="12_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >30</td><td align="center" valign="middle" >43</td><td align="center" valign="middle" >0.1412</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >44</td><td align="center" valign="middle" >43</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0.4831</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >33</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >5</td><td align="center" valign="middle" >0.1000</td></tr></tbody></table></table-wrap><table-wrap id="12_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >16</td><td align="center" valign="middle" >63</td><td align="center" valign="middle" >7</td><td align="center" valign="middle" >0.1860</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >15</td><td align="center" valign="middle" >73</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >0.8022</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >18</td><td align="center" valign="middle" >23</td><td align="center" valign="middle" >9</td><td align="center" valign="middle" >0.1800</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="13"><label><xref ref-type="table" rid="table1">Table 1</xref>3</label><caption><title> Classification results for PCE 25 case. Video 5 for training and Video 4 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="13_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >11</td><td align="center" valign="middle" >8</td><td align="center" valign="middle" >45</td><td align="center" valign="middle" >0.1719</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >27</td><td align="center" valign="middle" >29</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0.5000</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >10</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >0.5000</td></tr></tbody></table></table-wrap><table-wrap id="13_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >11</td><td align="center" valign="middle" >48</td><td align="center" valign="middle" >5</td><td align="center" valign="middle" >0.1719</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >17</td><td align="center" valign="middle" >41</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.7069</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >11</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.0417</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap id="table14" ><label><xref ref-type="table" rid="table1">Table 1</xref>4</label><caption><title> Tracking metrics for PCE full. Train using Video 4 and test using Video 5</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >4.33</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >54/89</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >6.64</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >71/89</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >5.09</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >25/89</td></tr></tbody></table></table-wrap><table-wrap id="table15" ><label><xref ref-type="table" rid="table1">Table 1</xref>5</label><caption><title> Tracking metrics for PCE 50. Train using Video 4 and test using Video 5</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >7.47</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >50/89</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >9.05</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >53/89</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >5.75</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >16/89</td></tr></tbody></table></table-wrap><table-wrap id="table16" ><label><xref ref-type="table" rid="table1">Table 1</xref>6</label><caption><title> Tracking metrics for PCE 25. Train using Video 4 and test using Video 5</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >7.58</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >31/89</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >7.99</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >30/89</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >5.2</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >11/89</td></tr></tbody></table></table-wrap><p>LWIR: Train using Video 5 and Test using Video 4</p><p>Figures 17-19 and Tables 17-19 summarize the LWIR study where Video 5 was used for training and Video 4 for testing. Similar to earlier section, we have decent performance when the compression is low. Some partial targets can be tracked. In general, the percentages of frames with detection are lower as compared to the case of using Video 4 for training and Video 5 for testing. Moreover, the overall performance of tracking of LWIR videos is inferior to that of MWIR videos.</p></sec><sec id="s4_2"><title>4.2. Classification Results</title><p>LWIR: Training Using Video 4 and Testing Using Video 5</p><p>We performed a comparative study between ResNet and the built-in YOLO classifiers. Tables 20-22 summarize the classification results for PCE full, PCE 50, and PCE 25, respectively. In each table, the left side shows the confusion matrix and the last column shows the classification accuracies. We observe that ResNet has much higher classification accuracy than YOLO. The results here are similar to those in the MWIR cases. That is, ResNet classification results are much better than those of YOLO.</p><p>LWIR: Training Using Video 5 and Testing Using Video 4</p><p>We have similar observations as the previous LWIR case. In the PCE full case (<xref ref-type="table" rid="table2">Table 2</xref>3), the ResNet results are very good for Ram and Frontier, but not for Silverado. When compression ratio is beyond 30 to 1, the classification rates drop significantly as can be seen in <xref ref-type="table" rid="table2">Table 2</xref>4 and <xref ref-type="table" rid="table2">Table 2</xref>5 in which Ram and Silverado have very poor classification rates. We think that, in the coded aperture camera case, we should not use high compression, as the targets will be smeared too much. Moreover, MWIR may be preferred over LWIR in target tracking and classification.</p><table-wrap id="table17" ><label><xref ref-type="table" rid="table1">Table 1</xref>7</label><caption><title> Tracking metrics for PCE full. Train using Video 5 and test using Video 4</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >9.73</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >34/110</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >8.17</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.98</td><td align="center" valign="middle" >55/110</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >8.55</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >23/110</td></tr></tbody></table></table-wrap><table-wrap id="table18" ><label><xref ref-type="table" rid="table1">Table 1</xref>8</label><caption><title> Tracking metrics for PCE 50. Train using Video 5 and test using Video 4</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >13.44</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >8/110</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >6.55</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >25/110</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >9.5</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >10/110</td></tr></tbody></table></table-wrap><table-wrap id="table19" ><label><xref ref-type="table" rid="table1">Table 1</xref>9</label><caption><title> Tracking metrics for PCE 25. Train using Video 5 and test using Video 4</title></caption><table><tbody><thead><tr><th align="center" valign="middle" ></th><th align="center" valign="middle" >CLE</th><th align="center" valign="middle" >DP</th><th align="center" valign="middle" >EinGT</th><th align="center" valign="middle" >Number of frames with detection</th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >15.32</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >4/110</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >7.96</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" >19/110</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >9.92</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >8/110</td></tr></tbody></table></table-wrap><table-wrap-group id="20"><label><xref ref-type="table" rid="table2">Table 2</xref>0</label><caption><title> Classification results for PCE full case. Video 4 for training and Video 5 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="20_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >35</td><td align="center" valign="middle" >14</td><td align="center" valign="middle" >0.0755</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >23</td><td align="center" valign="middle" >45</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.6522</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >11</td><td align="center" valign="middle" >14</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr></tbody></table></table-wrap><table-wrap id="20_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >36</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >17</td><td align="center" valign="middle" >0.6667</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >35</td><td align="center" valign="middle" >32</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >0.4507</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >13</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >0.4800</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="21"><label><xref ref-type="table" rid="table2">Table 2</xref>1</label><caption><title> Classification results for PCE 50 case. Video 4 for training and Video 5 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="21_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >31</td><td align="center" valign="middle" >13</td><td align="center" valign="middle" >0.0833</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >15</td><td align="center" valign="middle" >38</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.7170</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >13</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr></tbody></table></table-wrap><table-wrap id="21_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >25</td><td align="center" valign="middle" >20</td><td align="center" valign="middle" >5</td><td align="center" valign="middle" >0.5000</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >19</td><td align="center" valign="middle" >30</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >0.5660</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >12</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.0625</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="22"><label><xref ref-type="table" rid="table2">Table 2</xref>2</label><caption><title> Classification results for PCE 25 case. Video 4 for training and Video 5 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="22_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >22</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >0.1071</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >5</td><td align="center" valign="middle" >25</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.8333</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >11</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr></tbody></table></table-wrap><table-wrap id="22_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >11</td><td align="center" valign="middle" >19</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.3548</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >6</td><td align="center" valign="middle" >24</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.8000</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >11</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="23"><label><xref ref-type="table" rid="table2">Table 2</xref>3</label><caption><title> Classification results for PCE Full case. Video 5 for training and Video 4 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="23_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >7</td><td align="center" valign="middle" >22</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >0.2188</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >17</td><td align="center" valign="middle" >36</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.6792</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >21</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0.0870</td></tr></tbody></table></table-wrap><table-wrap id="23_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >30</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0.8824</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >13</td><td align="center" valign="middle" >35</td><td align="center" valign="middle" >7</td><td align="center" valign="middle" >0.6364</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >19</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >0.1739</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="24"><label><xref ref-type="table" rid="table2">Table 2</xref>4</label><caption><title> Classification results for PCE 50 case. Video 5 for training and Video 4 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="24_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >5</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.3750</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >24</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.9600</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >7</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >0.300</td></tr></tbody></table></table-wrap><table-wrap id="24_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >8</td><td align="center" valign="middle" >8</td><td align="center" valign="middle" >0.0000</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >10</td><td align="center" valign="middle" >14</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >0.5600</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >7</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >2</td><td align="center" valign="middle" >0.2000</td></tr></tbody></table></table-wrap></table-wrap-group><table-wrap-group id="25"><label><xref ref-type="table" rid="table2">Table 2</xref>5</label><caption><title> Classification results for PCE 25 case. Video 5 for training and Video 4 for testing. (a) YOLO classifier outputs; (b) ResNet classifier outputs</title></caption><table-wrap id="25_1"><caption><title> (b)</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >19</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >1.0000</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >1</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >0.3750</td></tr></tbody></table></table-wrap><table-wrap id="25_2"><caption><title></title></caption><table><tbody><thead><tr><th align="center" valign="middle"  colspan="2"   rowspan="2"  ></th><th align="center" valign="middle"  colspan="3"  >Actual</th><th align="center" valign="middle" ></th></tr></thead><tr><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >Classification Accuracy</td></tr><tr><td align="center" valign="middle"  rowspan="3"  >Predicted</td><td align="center" valign="middle" >Ram</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >4</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr><tr><td align="center" valign="middle" >Frontier</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >16</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.8421</td></tr><tr><td align="center" valign="middle" >Silverado</td><td align="center" valign="middle" >3</td><td align="center" valign="middle" >5</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.0000</td></tr></tbody></table></table-wrap></table-wrap-group></sec></sec><sec id="s5"><title>5. Conclusions</title><p>In this paper, we present a high-performance approach to target tracking and classification directly in the compressive sensing domain for MWIR and LWIR videos. Skipping the time consuming reconstruction step will allow us to perform real-time target tracking and classification. The proposed approach is based on a combination of two deep learning schemes: YOLO for tracking and ResNet for classification. The proposed approach is suitable for applications where limited training data are available. Experiments using MWIR and LWIR videos clearly demonstrated the performance of the proposed approach. One key observation is that the MWIR has better tracking and classification performance than that of LWIR. Another observation is that the ResNet has much better performance than the built-in classification in YOLO.</p><p>One potential direction is to integrate our proposed approach with real hardware to perform real-time target tracking and classification directly in the compressive sensing domain.</p></sec><sec id="s6"><title>Acknowledgements</title><p>This research was supported by the US Air Force under contract FA8651-17-C-0017. The views, opinions and/or findings expressed are those of the authors and should not be interpreted as representing the official views or policies of the Department of Defense or the U.S. Government.</p></sec><sec id="s7"><title>Conflicts of Interest</title><p>The authors declare no conflicts of interest regarding the publication of this paper.</p></sec><sec id="s8"><title>Cite this paper</title><p>Kwan, C., Chou, B., Yang, J., Rangamani, A., Tran, T., Zhang, J. and Etienne-Cummings, R. (2019) Target Tracking and Classification Using Compressive Measurements of MWIR and LWIR Coded Aperture Cameras. Journal of Signal and Information Processing, 10, 73-95. https://doi.org/10.4236/jsip.2019.103006</p></sec></body><back><ref-list><title>References</title><ref id="scirp.94197-ref1"><label>1</label><mixed-citation publication-type="other" xlink:type="simple">Li, X., Kwan, C., Mei, G. and Li, B. (2006) A Generic Approach to Object Matching and Tracking. 3rd International Conference Image Analysis and Recognition, Lecture Notes in Computer Science, Póvoa de Varzim, 18-20 September 2006, 839-849.  
https://doi.org/10.1007/11867586_76</mixed-citation></ref><ref id="scirp.94197-ref2"><label>2</label><mixed-citation publication-type="other" xlink:type="simple">Zhou, J. and Kwan, C. (2018) Tracking of Multiple Pixel Targets Using Multiple Cameras. 15th International Symposium on Neural Networks, Minsk, 25-28 June 2018, 484-493. https://doi.org/10.1007/978-3-319-92537-0_56</mixed-citation></ref><ref id="scirp.94197-ref3"><label>3</label><mixed-citation publication-type="other" xlink:type="simple">Zhou, J. and Kwan, C. (2018) Anomaly Detection in Low Quality Traffic Monitoring Videos Using Optical Flow. Pattern Recognition and Tracking, Vol. 10649.</mixed-citation></ref><ref id="scirp.94197-ref4"><label>4</label><mixed-citation publication-type="other" xlink:type="simple">Kwan, C., Zhou, J., Wang, Z. and Li, B. (2018) Efficient Anomaly Detection Algorithms for Summarizing Low Quality Videos. Pattern Recognition and Tracking, Vol. 10649. https://doi.org/10.1117/12.2303764</mixed-citation></ref><ref id="scirp.94197-ref5"><label>5</label><mixed-citation publication-type="other" xlink:type="simple">Kwan, C., Yin, J. and Zhou, J. (2018) The Development of a Video Browsing and Video Summary Review Tool. Pattern Recognition and Tracking, Vol. 10649.  
https://doi.org/10.1117/12.2303654</mixed-citation></ref><ref id="scirp.94197-ref6"><label>6</label><mixed-citation publication-type="other" xlink:type="simple">Zhao, Z., Chen, H., Chen, G., Kwan, C. and Li, X.R. (2006) IMM-LMMSE Filtering Algorithm for Ballistic Target Tracking with Unknown Ballistic Coefficient. Proceedings SPIE, Vol. 6236, Signal and Data Processing of Small Targets.  
https://doi.org/10.1117/12.665760</mixed-citation></ref><ref id="scirp.94197-ref7"><label>7</label><mixed-citation publication-type="other" xlink:type="simple">Zhao, Z., Chen, H., Chen, G., Kwan, C. and Li, X.R. (2006) Comparison of Several Ballistic Target Tracking Filters. Proceedings of American Control Conference, Minneapolis, 14-16 June 2006, 2197-2202.</mixed-citation></ref><ref id="scirp.94197-ref8"><label>8</label><mixed-citation publication-type="other" xlink:type="simple">Candes, E.J. and Wakin, M.B. (2008) An Introduction to Compressive Sampling. IEEE Signal Processing Magazine, 25, 21-30.  
https://doi.org/10.1109/MSP.2007.914731</mixed-citation></ref><ref id="scirp.94197-ref9"><label>9</label><mixed-citation publication-type="other" xlink:type="simple">Kwan, C., Chou, B. and Kwan, L.M. (2018) A Comparative Study of Conventional and Deep Learning Target Tracking Algorithms for Low Quality Videos. 15th International Symposium on Neural Networks, Minsk, 25-28 June 2018, 521-531.  
https://doi.org/10.1007/978-3-319-92537-0_60</mixed-citation></ref><ref id="scirp.94197-ref10"><label>10</label><mixed-citation publication-type="other" xlink:type="simple">Kwan, C., Chou, B., Yang, J. and Tran, T. (2019) Target Tracking and Classification Directly in Compressive Measurement for Low Quality Videos. Pattern Recognition and Tracking, Baltimore, 16-18 April 2019. https://doi.org/10.1117/12.2518496</mixed-citation></ref><ref id="scirp.94197-ref11"><label>11</label><mixed-citation publication-type="other" xlink:type="simple">Kwan, C., Chou, B., Echavarren, A., Budavari, B., Li, J. and Tran, T. (2018) Compressive Vehicle Tracking Using Deep Learning. IEEE Ubiquitous Computing, Electronics &amp; Mobile Communication Conference, New York, 8-10 November 2018.</mixed-citation></ref><ref id="scirp.94197-ref12"><label>12</label><mixed-citation publication-type="other" xlink:type="simple">Zhang, J., Xiong, T., Tran, T., Chin, S. and Etienne-Cummings, R. (2016) Compact All-CMOS Spatio-Temporal Compressive Sensing Video Camera with Pixel-Wise Coded Exposure. Optics Express, 24, 9013-9024.  
https://doi.org/10.1364/OE.24.009013</mixed-citation></ref><ref id="scirp.94197-ref13"><label>13</label><mixed-citation publication-type="other" xlink:type="simple">Tropp, J.A. (2004) Greed Is Good: Algorithmic Results for Sparse Approximation. IEEE Transactions on Information Theory, 50, 2231-2242.  
https://doi.org/10.1109/TIT.2004.834793</mixed-citation></ref><ref id="scirp.94197-ref14"><label>14</label><mixed-citation publication-type="other" xlink:type="simple">Dao, M., Kwan, C., Koperski, K. and Marchisio, G. (2017) A Joint Sparsity Approach to Tunnel Activity Monitoring Using High Resolution Satellite Images. IEEE Ubiquitous Computing, Electronics &amp; Mobile Communication Conference, New York, 19-21 October 2017, 322-328.  
https://doi.org/10.1109/UEMCON.2017.8249061</mixed-citation></ref><ref id="scirp.94197-ref15"><label>15</label><mixed-citation publication-type="other" xlink:type="simple">Zhou, J., Ayhan, B., Kwan, C. and Tran, T. (2018) ATR Performance Improvement Using Images with Corrupted or Missing Pixels. Pattern Recognition and Tracking, Vol. 10649, 106490E.</mixed-citation></ref><ref id="scirp.94197-ref16"><label>16</label><mixed-citation publication-type="other" xlink:type="simple">Yang, J. and Zhang, Y. (2011) Alternating Direction Algorithms for 1-Problems in Compressive Sensing. SIAM Journal on Scientific Computing, 33, 250-278.  
https://doi.org/10.1137/090777761</mixed-citation></ref><ref id="scirp.94197-ref17"><label>17</label><mixed-citation publication-type="other" xlink:type="simple">Applied Research LLC, Phase 1 Final Report, August 2016.</mixed-citation></ref><ref id="scirp.94197-ref18"><label>18</label><mixed-citation publication-type="other" xlink:type="simple">Yang, M.H., Zhang, K. and Zhang, L. (2012) Real-Time Compressive Tracking. European Conference on Computer Vision, Florence, 7-13 October 2012, 864-877.</mixed-citation></ref><ref id="scirp.94197-ref19"><label>19</label><mixed-citation publication-type="other" xlink:type="simple">Kwan, C., Chou, B., Yang, J., Rangamani, A., Tran, T., Zhang, J. and Etienne-Cummings, R. (2019) Target Tracking and Classification Directly Using Compressive Sensing Camera for SWIR Videos. Journal of Signal, Image, and Video Processing, 1-9. https://doi.org/10.1007/s11760-019-01506-4</mixed-citation></ref><ref id="scirp.94197-ref20"><label>20</label><mixed-citation publication-type="other" xlink:type="simple">Redmon, J. and Farhadi, A. (2018) YOLOv3: An Incremental Improvement.</mixed-citation></ref><ref id="scirp.94197-ref21"><label>21</label><mixed-citation publication-type="other" xlink:type="simple">He, K., Zhang, X., Ren, S. and Sun, J. (2016) Deep Residual Learning for Image Recognition. Conference on Computer Vision and Pattern Recognition, Las Vegas, 27-30 June 2016, 770-778. https://doi.org/10.1109/CVPR.2016.90</mixed-citation></ref><ref id="scirp.94197-ref22"><label>22</label><mixed-citation publication-type="other" xlink:type="simple">Bertinetto, L., Valmadre, J., Golodetz, S., Miksik, O. and Torr, P. (2016) Staple: Complementary Learners for Real-Time Tracking. Conference on Computer Vision and Pattern Recognition, Las Vegas, 27-30 June 2016, 1401-1409.  
https://doi.org/10.1109/CVPR.2016.156</mixed-citation></ref><ref id="scirp.94197-ref23"><label>23</label><mixed-citation publication-type="other" xlink:type="simple">Stauffer, C. and Grimson, W.E.L. (1999) Adaptive Background Mixture Models for Real-Time Tracking, Computer Vision and Pattern Recognition. IEEE Computer Society Conference, Vol. 2, Ft. Collins, 23-25 June 1999, 2246.</mixed-citation></ref><ref id="scirp.94197-ref24"><label>24</label><mixed-citation publication-type="other" xlink:type="simple">Ren S., He, K., Girshick, R. and Sun, J. (2015) Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks. Advances in Neural Information Processing Systems, Montreal, 7-12 December 2015, 91-99.</mixed-citation></ref><ref id="scirp.94197-ref25"><label>25</label><mixed-citation publication-type="other" xlink:type="simple">https://www.opto-e.com/resources/infrared-theory</mixed-citation></ref><ref id="scirp.94197-ref26"><label>26</label><mixed-citation publication-type="other" xlink:type="simple">http://www.oktal-se.fr/website/index.php/solutions-system-design</mixed-citation></ref></ref-list></back></article>